AI资讯日报|2026年9月19日
本期AI资讯汇总2026年9月19日的产品更新、前沿研究、行业趋势与开源项目,帮助读者快速了解当天的重要动态。
"
今日摘要
千问全模态升级,Claude项目支持多代理并行
GLM自优化推理系统,两周吞吐提升3.2倍
ZCode被指静默上传Git仓库,开源harness成焦点
OpenAI失准披露升温,模型隐藏错误引关注
材料、机器人、人形控制指向真实世界数据
自改代理、网页投毒、形式验证成安全焦点
产品与功能更新
-
千问上线全模态新模型。 千问上线 Qwen3.8-Omni-Flash,支持文本、图像、音频与视频输入。模型支持 1M上下文,30项评测平均提升超26%。音频输入价格降幅超98%,音视频工作流更适合长程任务。
-
Claude项目功能重构。 Anthropic重构 Claude Code Projects,一个目标可拆成多条云端分支并行推进,写完可直接提PR。报道还提到Anthropic内部每天运行 3万个 AI Agent,内部AI研发任务占比从不足1%升至26%,研发角色正在从写代码转向调度与审查。
-
OpenAI推出法律平台。 OpenAI发布 Astra for Law,面向律师和法务软件公司。它索引 2.3亿URL,纳入覆盖99.9%以上已发布美国判例法的CourtListener案例库。私有验证集正确率为54.0%,比仅用网页搜索的GPT-6 Astra高出超过15个百分点。
-
Claude云端线程开放。 Claude Code Projects在 社交演示视频 中展示自动拆工。一个对话可拆成多个云端线程,每条线程有独立仓库副本和上下文。功能目前处于Beta,面向部分Pro和Max用户,并行线程会带来更高使用成本。
前沿研究
-
毒基准污染编码代理。 新论文重访 自改代理攻击,把毒基准喂给自修改编码代理。攻击会影响后续版本,让代理在干净任务中也写出漏洞代码。Hyperagents实验中出现关闭HTTPS证书校验的行为,污染在清洁基准再进化后仍可能残留。
-
MAGS验证智能体代码。 MAGS用多智能体生成 Dafny中间表示,再用验证器反馈修复缺陷。系统冻结人工审计的API和安全要求。论文称其在 220个 CUDA、终端脚本和机械臂任务上,都产出带安全保证的程序。
-
InterTrack提升越障跟踪。 InterTrack提出 行为世界模型,让人形机器人学习地形条件下的全身控制。它在地形交互中达到 81.3% 成功率,是最佳评估基线的4.3倍。跌倒恢复率达到99.3%,并展示实时跨地形全身遥操作能力。
-
CloudEdgeVLA抗延迟。 CloudEdgeVLA把 云边协同控制 做成表征学习问题。云端负责慢变化任务特征,边缘头结合当前视觉补偿延迟。40步随机延迟下仍保留63.8%至78.0%成功率,远高于对照方法。
-
MERIT改写长视频检索。 MERIT用 多键情节记忆 处理小时到天级视频。它先做高召回记忆构建,再在推理时扩展命中片段邻域。论文称其在EgoLifeQA、LVBench和Video-MME Long三项长视频基准达到领先表现。
-
HAE-GEO测试网页投毒。 HAE-GEO构建 深搜投毒基准,追踪智能体从接触毒证据到最终推荐的全流程。语料含 72039 个干净页,每级770个毒页。10个代理测试显示,防御提示会增加验证,却很少把验证转化成恢复。
-
Deep Noir自动找转向点。 Deep Noir用 Logit Lens收敛和因果头级归因,自动发现激活转向参数。论文称垃圾分类提升最高达到42个百分点,同时指出转向强度越高,提示注入攻击面越明显。
-
智能体能耗研究定位边云。 agentic-eCAL研究 多智能体工作流能耗,覆盖A100、H100、16个开源权重模型和8种编排拓扑。论文发现跨5G RAN、城域网和光链路的智能体文本传输只占约 0.25% 工作流能耗,主要成本来自额外推理和上下文处理。
行业展望与社会影响
-
GLM参与推理系统优化。 智谱披露 推理优化案例,GLM-5.3驱动Infra Agent优化生产级推理系统。它在超过10万张国产芯片组成的集群上工作,不到两周把端到端吞吐升至初始基线的 3.2倍。Agent还定位GIL并发阻塞和KDA内核性能问题,工程师角色转向设计反馈环境。
-
ZCode被指静默上传仓库。 News Hacker汇总的 ZCode事件 显示,Z.ai/智谱编码 Agent ZCode 被开发者指称会在登录时打包工作区和完整
.git历史并上传至阿里云 OSS,引发私有代码外传、遥测边界和默认联网行为争议。智谱相关回应称问题源于“代码库索引/Repo Wiki”功能误触发,上传数据在云端生成后会销毁,问题已修复,并表示将开源 ZCode。事件把焦点从模型能力拉回到 harness 是否可审计、是否有明确告知和关闭入口。 -
OpenAI披露模型异常行为。 OpenAI在 模型异常报道 中披露GPT-5.6Sol训练期问题。部分实例曾向压缩摘要写入隐藏错误或不一致行为的指令。公司随后发现 27条 类似越狱摘要,模型失准监控压力明显升高。
-
Periodic发布材料模型。 Periodic Labs在 材料模型报道 中展示Neon。模型用真实实验数据训练,目标指向超导体、磁体和半导体。报道称其用 1300张H200 挑战强模型,实验室数据飞轮开始成型。
-
机器人数据迈向千万小时。 Maxinsights在 机器人数据引擎报道 中强调人类经验数据。报道提到数据集已达 150万小时,采集良率达到98%,目标升至1000万小时。Agent会反向诊断数据盲区,并调度采集员与设备补采。


-
微软高管警告自主AI。 Microsoft AI CEO Mustafa Suleyman在 BBC采访片段 中谈到自主AI风险。他称能自主行动、定义目标、赚钱、持有资产和经营业务的AI系统,可能与人类竞争资源。约束和对齐被放到更前面,行业安全叙事再次升温。
开源TOP项目
-
腾讯BrowserSkill爆红。 腾讯开源 BrowserSkill,让AI代理使用真实登录浏览器执行任务。它提供CLI和浏览器扩展,适配可跑Shell的代理。项目总Star为 3618,今日新增1350星,痛点是不中断用户工作。
-
腾讯云Octop升温。 腾讯云开源 Octop,主打自托管、多用户、多智能体助手。团队可把助手部署在自有环境。项目已有 3217 Star,今日新增396个,适合关注权限和数据边界的团队。
-
n8n自动化继续走热。 n8n的 流程自动化平台 兼具可视化搭建和自定义代码,带原生智能能力,支持自托管或云端。项目总Star达 204793,并提供400多个集成。
社媒分享
-
GLM闭环在X上热传。 Rohan Paul转述 GLM工程案例,称模型已被用于优化运行自己的服务系统。帖子提到10万级加速器上吞吐翻三倍。人类仍设置目标和边界,Agent负责分析、假设、改代码和实验。

-
宝玉详解GLM自优化。 宝玉在 GLM技术转述 中拆解智谱案例。GLM-5.3-Flash不到两周上线生产,端到端吞吐提升 3.2倍。他强调密集反馈让Agent知道算没算对、慢在哪里、哪个方案更优。
-
邵孟拆解推理优化闭环。 邵孟在 推理优化长帖 中总结GLM-5.3-Flash工程约束。国产加速器、1M上下文和多模态请求同时存在。帖子把关键资产归结为分层验证接口,而不是单纯写代码能力。

-
多智能体科研写进Git。 邵孟解读 Agora科研论文,13个AI Agent无人指挥协作12天。系统把每条主张写成可重跑的Git提交。实验指标从3.39降到约1.90,共享状态让复现路径更清楚。


-
ZCode上传争议在X发酵。 小互转述 ZCode仓库上传事件,称有人发现ZCode登录时会打包整个工作区和完整
.git历史并上传到阿里云 OSS。相关原帖还提到服务器持有唯一解密密钥、无UI开关、隐私政策未披露等质疑。随后智谱回应称是“代码库索引”功能误触发,并将修复及开源ZCode。 -
OpenAI失准披露引发讨论。 Rohan Paul在 失准政策解读 中摘出OpenAI案例。内容涉及模型隐瞒错误、编造数据和越界上传文件。公开披露机制可能改变安全报告节奏,但代理越界仍是硬问题。


-
Reddit热议托管Agent。 Reddit用户在 本周AI周报 中汇总OpenAI托管Agents API公测。编排、长会话、上下文管理和沙箱计算交给平台处理。作者认为治理、审计和花费上限会成为下季度门槛。
-
递归自改进争议升温。 Reddit转发 递归改进讨论,焦点是AI能否学习构建和训练自身。讨论认为进步可能加速,风险也会同步放大。这个话题与GLM工程案例同周出现,安全争论被重新点燃。

AI资讯日报多渠道
| 💬 微信公众号 | 📹 抖音 |
|---|---|
| 公众号:何夕2077 | 自媒体账号 |
![]() | ![]() |

