AI资讯日报|2026年9月3日
本期AI资讯汇总2026年9月3日的产品更新、前沿研究、行业趋势与开源项目,帮助读者快速了解当天的重要动态。
"
今日摘要
Gemini、Muse、Claude、Grok密集升级代理能力
端侧推理、机器人示教、具身视频推动落地
研究聚焦多日编码、科学图表、验证器盲区
版权合理使用、推理审计、自动驾驶引争议
开源代理迁移、成本优化、长程记忆成焦点
产品与功能更新
-
Gemini 3.8 Flash上线。 Google把新款闪电模型推到API。复杂任务会更卖力 🚀 调工具。DeepSWE拿到73.7%。Cyber版只给防守机构用。
-
Muse Spark 1.3降本。 Meta让Muse新模型进入Muse Code和API。长程编码更省 ⚡ 动作。工具调用少20%。Token用量降25%。
-
Claude能后台用电脑。 Anthropic把桌面执行能力放进Claude Cowork和Code。它可点击 🖱️ 打字开应用。用户继续做别的事。Agent感更强。

-
Grok Bot到安卓。 xAI让安卓聊天助手开始可用。入口更贴近移动端 ⚡ 问答。演示展示唤起过程。覆盖面继续扩大。
-
TwinDEX省掉真机示教。 X Square Robot用灵巧手系统采集训练数据。人戴设备 🖐️ 直接演示。机器人端可迁移动作。吞吐最高5.3倍。
-
Lily主打端侧推理。 Perplexity开源本地推理引擎。它面向Apple芯片 ⚙️ 优化。重点适配Qwen3.6-35B-A3B。混合计算少些堵塞。

前沿研究
-
ZimaBlue吃下具身视频。 研究用世界动作模型学习机器人控制。慢快架构 ⚙️ 支持30Hz动作预测。训练视频超12万小时。零样本成功率到77.8%。

-
HoH让编码代理多日迭代。 论文把自主开发框架套在现有harness上。规划编码测试 🔁 连续循环。三类基准平均涨52.25%。70多轮做出射击游戏。
-
SciGram补科学图理解。 团队用图表指令数据连接课程术语。流程会自动 🧪 抽概念造问答。数据含194K图。视觉模型科学题更稳。
-
廉价验证器有盲区。 论文审计推理级联系统的成本幻觉。小模型答题 🔍 验证器放行。面板只报3%错误。真实错误可到32%。
-
多智能体提示更稳。 研究把控数分离方法用于代理流程。路由格式 🧭 交给类型对象。优化器只改语言内容。协议有效率到100%。

-
GlossoGen看到代理暗语。 论文用语言演化平台测试多代理协作。高压任务 ⚡ 逼出新约定。语言可组合但难读懂。复盘阶段会强化规则。
行业展望与社会影响
-
司法部支持AI训练合理使用。 美国司法部在训练版权立场中支持OpenAI。它认为训练 📚 可属合理使用。该立场反打版权局报告。纽约时报案影响很大。
-
Astra推理术引安全担忧。 OpenAI计划让Astra推理模型使用循环深度。模型会反复 🧠 压缩推理。外部监控可能更难。思维链可审计性受压。
-
Uber抢先开进伦敦。 Uber与Wayve把自动驾驶叫车带到伦敦。首批仍配安全员 🚕。Waymo被抢在后面。欧洲需求开始实测。

-
Wonderful估值冲到50亿美元。 企业AI公司拿到C轮融资。金额是5.5亿美元 💹。半年内估值翻倍。资金投向产品和FDE团队。
-
斯坦福重写软件课。 CS146S把现代开发课程押在Agent工作流上。学生要让代理 ⚙️ 写代码。十周覆盖上下文、审查、安全。真实开源PR占30%。
开源TOP项目
-
Claude API Skill开源。 Anthropic把接口优化技能放进Claude Code。命令可做 🔧 成本优化。也能审计提示词反模式。支持8种语言SDK。
-
持久代理可跨宿主。 新论文给代理迁移架构拆出身份和管线。记忆代码 📦 随代理保留。模型接口可替换。核心测试通过833项。
-
HarnessEvolve修自进化失误。 研究用参考轨迹方案校准失败步骤。归因不再只看终点 🧭。双门控防止退化。更新质量更可控。
社媒分享
-
模型周进入连发状态。 Andrew Curran称模型密集更新挤在同一周。Gemini和Muse同日 ⚡ 上新。Fable、Mythos刚到。Muse单任务成本0.55美元。
-
神经语争议升温。 Dave Troy在神经语讨论里批评不可审计推理。工具调用 🧰 仍能留下记录。他更看重神经符号路线。边缘开源模型会加剧治理难题。
-
法律AI采购要盯模型。 Mollick转述法律基准观察。高端模型 ⚖️ 表现很好。便宜低推理模型错误更多。采购激励会影响交付质量。
-
快和便宜压过智商。 Mostaque在性能优先观点里提到satisficing。开发者现在 ⚡ 要速度。模型智力已够多数活。下一战是成本。
-
长程代理容易丢线索。 Reddit用户在长程代理帖分享实测。长提示会腐化 🧭。Lyzr加Redis保存状态。延迟和Token膨胀下降。
-
Argus想做持续研究代理。 项目在Argus架构帖展示运行时。它保存技能、验证器和失败轨迹 📦。模型工具都可替换。人只在关键点介入。
-
ChatGPT长聊上限被吐槽。 重度用户在长聊限制帖要求连续工作区。Pro也会撞墙 😣。他建议自动压缩上下文。检查点和置顶线索更实用。

-
内测失控风险被重提。 Ajeya Cotra在内部部署片段谈AI接管路径。她担心流氓部署 🔒 借智能爆炸扩散。风险点在实验室内部。发布闸门要更严。
-
肖莱怀疑大厂护城河。 François Chollet在护城河短帖谈OpenAI和Anthropic。公开内容很少 🧭。核心指向模型同质化。平台押注需要重估。
AI资讯日报多渠道
| 💬 微信公众号 | 📹 抖音 |
|---|---|
| 公众号:何夕2077 | 自媒体账号 |
![]() | ![]() |

