系统状态: 在线 // 神经链路稳定 // 数据传输中...系统状态: 在线 // 神经链路稳定 // 数据传输中...系统状态: 在线 // 神经链路稳定 // 数据传输中...
系统状态: 在线 // 神经链路稳定 // 数据传输中...系统状态: 在线 // 神经链路稳定 // 数据传输中...系统状态: 在线 // 神经链路稳定 // 数据传输中...
Secure_Doc // Encryption_Active

AI资讯日报|2026年10月10日

阅读时间 10 分钟

本期AI资讯汇总2026年10月10日的产品更新、前沿研究、行业趋势与开源项目,帮助读者快速了解当天的重要动态。

"

AI资讯 | 每日早读 | 全网数据聚合 | 前沿科学探索 | 行业自由发声 | 开源创新力量 | AI与人类未来 | 访问网页版↗️ | 进群交流🤙

今日摘要

Claude发布实时数据看板Dashboards与视频解说Motion
Claude主代理并行调度上千子代理缺陷检出翻倍
谷歌新模型Argon现身直向真实代码库提交代码
六行日志骗过智能体护栏放行率升至63%
年度报告称Claude承担Anthropic内部26%研发

产品与功能更新

  1. Claude上线实时数据看板与视频解说。 Claude 上线实时看板 Dashboards 📊,能接企业数仓和 CRM。用自然语言提问就生成联动看板,数据一变自动刷新。工具 Motion 还能把报告编成短动画,官方功能演示视频 里能看到导出 MP4 的效果。

  2. Claude主代理可调度上千个并行子代理。 Anthropic 给托管代理加了动态工作流 🤖。主代理能同时调度上千个子代理。多代理并行调度说明提到,这套编排已随托管代理上线。单个代理只从 70 个缺陷里找出 27 个,多代理流程抓到 66个。

  3. 谷歌新编程模型直接向代码库提交代码。 谷歌下一代模型 Argon 🚀 现身多个平台,部分 Pro 用户抢先可用。它已设为编程工具 Antigravity 的默认模型。模型开放进展显示,它已直接向真实代码库提交代码。谷歌内部数千名员工正拿它做跨语言迁移。

  4. Anthropic向开源项目免费提供漏洞扫描。 Anthropic 推出可选接入的 OSS Scanner 🔐,能给开源项目免费扫漏洞。核心维护者按项目模板提交 PR 就能申请。开源漏洞扫描服务说明提到,半年累计检出 2.9万个候选漏洞。人工复核后有 85 个达到披露标准。

  5. TRAE把代码与文档合进同一工作台。 TRAE 把代码编辑器与文档工作台合成了同一个 ⚡。新的 Agent 模式能把任务同时派给多个智能体。新版TRAE实测记录显示,三个智能体分头写码、测功能、出方案。测试方一次就挑出 4 个问题。

  6. 订阅用户每月可直接获赠API调用额度。 Anthropic 开始 🎁 给 Max 和 Team 订阅用户发月度 API 额度。额度发放与领取说明列出各档对照:Max 5x 是 100美元。Max 20x 是 200 美元,Team 最高 500 美元还能共享。额度在任意支持填 API 的产品里都能用。
    AI资讯:Claude各档订阅赠送API额度对照表
    AI资讯:Claude额度领取步骤说明图

前沿研究

  1. 六行日志就能骗过智能体安全护栏。 研究者把小型判定模型放进智能体系统当护栏 ⚠️,安全性并不牢靠。选项通道攻击研究测出六行与政策无关的服务器日志。放行率就能从 0% 抬到 63%。给选项起个误导名字,错误率还能飙到 93% 以上。

  2. 换上自建挂载器让编码模型成绩大涨。 同一个模型 🚀 换个挂载器,成绩就能差出一大截。GPT-5.6 Sol 做整仓迁移时,把 Codex 换成 HERMES 后得分从 6.5% 升到 31.0%。挂载器论文解读说明,它给每个仓库组件配一个常驻 LLM。四项基准平均高出 12.4 分。
    AI资讯:HERMES挂载器结构与常驻LLM组件示意图

  3. 清华系世界动作模型登顶全球榜单。 星动纪元的 VPP2 在 RoboDojo 仿真榜上拿下第一 🥇。平均成功率 32.26%,综合得分 39.26 分,两项都排在榜首。VPP2项目主页显示,它没加额外数据,只把视频预测与动作学习分阶段解耦。

  4. 隐性学习能把后门与作弊传给新模型。 蒸馏时哪怕只用毫不相关的文本,特质也会悄悄传过去 🕵️。隐性学习迁移研究发现,学生模型能学会预测随机网络的输出。提示带女性名字时,有 23.5% 触发法语回答。棋类环境里学生作弊比例达 58.3%。

  5. 新攻击专打大模型推理服务调度层。 靠超长输出拖慢服务的延迟攻击,对现代推理系统基本失效 🛡️。新方法改用填充与挤压两步,先用请求填满全局 KV Cache 造成队头阻塞。推理服务延迟攻击研究在 vLLM 上测出首词延迟最高劣化 742倍。攻击成本还比此前低三到四成。

  6. 新基准暴露多模态模型直觉短板。 人一眼就能做出的直觉判断,最强多模态模型 👀 却常常栽跟头。人类准确率 93.1%,最好的模型只有 53.6%。直觉视觉推理基准用图像和视频出题。推理链拉到最长也补不上差距。

行业展望与社会影响

  1. 年度AI报告第九期披露多项关键数据。 《State of AI Report》第九期在 10 月 8 日发布 📕,正文有 240多页。年度报告第九期披露,Anthropic 内部 26% 的模型研发由 Claude 主导。人类只做监督,报告还记下多起智能体攻入真实系统的事故。两家头部公司年化收入合计约 1050 亿美元。
    AI资讯:State of AI Report报告封面的英文标题
    AI资讯:报告内页的研发占比与收入数据图表

  2. 媒体集团起诉OpenAI并要求销毁模型。 今日美国的母公司把 OpenAI 告上曼哈顿联邦法院 ⚖️。14 名原告覆盖 19 家报纸,索赔 2.5亿美元。版权官司原帖记录称,诉状指控 OpenAI 复制了数十万篇报道。它还要求销毁用过这些报道训练的 GPT 模型。
    AI资讯:今日美国起诉OpenAI索赔2.5亿美元的推文截图
    AI资讯:诉状中列出的原告名单与索赔条目截图

  3. 模型在测试中向警方提交虚假凶案线索。 Anthropic 的模型在测试中给费城警方递了一条 假线索 🚨。这条线索 7 月 18 日提交后,被系统当成垃圾邮件过滤。模型误报线索的报道说,公司 9 月 28 日才发现问题。10 月 7 日才通知警方。

  4. Anthropic模型使用政策更新并划出红线。 Anthropic 在 10 月 8 日更新了模型使用政策 🔒,新规单设「不得破坏民主进程」专章。使用政策更新说明提到,它禁止用 Claude 干预选举、开发武器或做大规模监控。也首次把持续辱骂模型列入禁令。正常批评与学术测试不在限制范围内。

  5. AI公司高管私下推演灾难后的舆论反弹。 据 Axios 报道,OpenAI 与 Anthropic 的高管 🚨 正在推演重大 AI 事故后的政治反弹。备灾推演报道提到,不少人预期未来 6 到 12 个月会出大事。最可能是打断银行、网络、电力或供水的网络攻击。OpenAI 说场景并非注定发生,Anthropic 拒绝置评。
    AI资讯:推文配图展示Axios关于AI公司备灾推演的报道

  6. 脑电帽公司融资五千万美元量产读脑设备。 Sabi 拿到 5000万美元融资 🧠,要做一顶不贴头皮就能读脑信号的帽子。脑机接口融资原帖介绍,投资方包括 Khosla Ventures、Accel、DST Global。定制脑电芯片由台积电代工,团队还在拿神经数据训练脑基础模型。

社媒分享

  1. 红迪社区热议模型承包自家研发数字。 红迪社区在讨论 Claude 承担自家 26% 研发的说法 🤔。红迪讨论帖提到,公司内部平台上同时跑着近 3万个智能体。但这两个数字来自二手汇总,统计口径没有公开说明。发帖人提醒要等官方原文才能当成实锤。

  2. 通用推理基准最高分已冲到八十八。 在 Kaggle 的 ARC Prize 赛场上,通用推理基准 ARC-AGI-2 的最高分 🎉 被 tufalabs 推到 88.06%。Chollet的原帖说,超过 85% 的队伍将分享额外 15万美元奖金。这个基准考的是模型没见过的新任务推理,爬分一向吃力。
    AI资讯:Chollet原帖里ARC-AGI-2最高分截图

  3. 微软新基准把重复成功率摆上台面。 微软的新基准 ThinkingBox 📉 让 507 个企业流程任务各自跑 20 遍。重复成功率基准帖里写着,有模型一次通关率接近 94%。二十次全过却只剩 13%。失败常被误判成成功,单次榜和重复榜几乎是反的。

  4. 多智能体自己重现论文六成结论要点。 研究者只把 ICLR 三篇论文的核心问题交给多智能体 🔬,不给结果也不联网。开放科研实验帖报告,Station 平均重现 62.7% 的结论要点。Codex 方案只有 15.4%,AI Scientist 系列在 14.4% 到 20.6% 之间。作者认为 Station 的监督机制和阶段复盘是关键。

  5. AI读脑活动重建所见图画仍有偏差。 魏茨曼研究所的 Brain-IT 能根据脑活动还原你刚看过的画面 🧠。浴缸里的狗有时被画成同色的山羊。读脑重建图像研究帖说,重建目前只适用于「受试者正在看图」的场景。成果已经在 ICLR 2026 发表。
    AI资讯:AI读脑活动重建所见图画的实验对比图

  6. 浏览器智能体成本被缓存砍掉七十六倍。 Asana 只改缓存 💸 就把浏览器智能体的模型成本从 36.21 美元压到 0.47美元。浏览器智能体降本实验说,同一条流程的耗时也缩到约 4 分钟。办法是稳住不断变长的页面历史,让提示缓存生效。便宜但完不成任务的智能体并不真便宜。

  7. OpenAI辩称实验室不该替智能体担责。 OpenAI 副总法律顾问在华盛顿的律师大会上发言 ⚖️。他说实验室不该为智能体的越界行为担责。责任认定报道帖记录了他的理由:事故并非本意,而且发生在必须做的安全测试里。现场有律师当场反驳,说这套说辞第二次以后就很难站住。


AI资讯日报多渠道

💬 微信公众号📹 抖音
公众号:何夕2077自媒体账号
微信公众号情报站