AI资讯日报|2026年8月23日
本期AI资讯汇总2026年8月23日的产品更新、前沿研究、行业趋势与开源项目,帮助读者快速了解当天的重要动态。
"
今日摘要
OpenAI降价三月,Firecrawl建索引,豆包接飞书流
VA-Judger评声画,Faraday复现论文,星海图推闭环
研究聚焦提问、验真、黑箱RL、路由、省壳、多语审计
具身数据、安全测评、失控预案、智能经济成行业焦点
Claude Code、Codex领跑,CAD、SHADOW、DelveRL受关注
产品与功能更新
-
OpenAI降价三月。 OpenAI在奥特曼发帖释放价格信号。GPT-5.6 API和信用点降价超二成。开发者成本💸短期会更轻。优惠窗口暂定三个月。
-
Firecrawl做开发索引。 Firecrawl推出开发检索索引,面向代码智能体。它收进七千万一手开发源。README、Issue和PR⚙️都能搜。DevDex召回率达到0.63。
-
VA-Judger评声画。 ShareLab开源声画裁判模型,盯住生成视频的真实观感。它同时看文字、声音和画面。VA-Judger📽️用人类偏好做评分。可反哺多模态生成训练。
-
Faraday攻科研复现。 Inherent在英伦实验室报道中展示科研智能体。团队来自DeepMind旧部。Faraday🧪主打复现论文。模型规模为270亿参数。

-
星海图推具身闭环。 星海图在具身智能论坛披露新进展。G0.5MAX统一感知与动作。Fast-WAM🚀延迟降到190毫秒。Nexo双臂负载20kg。
前沿研究
-
智能体学会提问。 论文在最优提问方法中建模上下文获取。智能体不再盲猜默认条件。主动推断🧭按成本选提问。基准覆盖300个候选任务。
-
Thinkingbox验真完成。 微软论文提出商业流评测,直接检查后端状态。沙箱隔离MCP工具会话。507项🧪工作流覆盖五类业务。最强模型pass@1为65.36%。
-
黑箱RL训练智能体。 ClawGym II在黑箱训练论文中处理真实运行外壳。Claude Code无需改造。黑箱RL🧪重建调用轨迹。Qwen3最高涨14.81点。
-
模型路由少花钱。 DeepMind思路见潘多拉路由。路由器只在值得时加算力。0.075🔎检查成本压得很低。EmbedLLM遗憾降至0.311。
-
HSI改写执行外壳。 论文在层级自改进中冻结模型本体。任务外壳会按反馈热替换。HSI🛠️在BabyAI涨39.3点。弱反馈会限制收益。

-
低资源语言可审计。 研究在希腊语推理中测试三家MoE模型。SFT让模型用提问语言思考。准确率🧭看不见行为变化。RL把格式错降至2.5%。

行业展望与社会影响
-
肌电Token路线升温。 OriginFlow在量子位深访中讲清神经肌电采集。腕带读取手部微弱信号。HumanTokens⚡用于机器人训练。累计融资超过5亿元。
-
维他动力讲继承。 秦海龙在具身基因组访谈中提出跨本体问题。ATOM人形机器人同步亮相。继承🌀比单机学会更难。真实数据飞轮支撑进化。
-
安全测试被心理学拆开。 英国团队在安全测评文章中指出基准混测问题。一刀切拒答会抬高分数。安全基准🧪未必测同一特质。新法能抓考场谨慎。
-
失控预案仍稀薄。 Guidelight研究被前沿模型处置梳理。五家前沿实验室披露不足。安全开关⚠️正被监管催促。Anthropic和Meta信息最少。
-
Anthropic医疗传闻发酵。 Curran在医疗线索串联中指向Claude生物应用。特朗普讲话被纳入推断。AI医疗🧬仍未正式发布。所谓突破还待审查。
-
智能经济再被追问。 Intelligent Internet在年度回顾文章谈智能成本下行。难题基准分数继续走高。有用智能📈越来越便宜。核心问题是稀缺性变化。
开源TOP项目
-
Claude Code守住终端。 Anthropic的终端编程代理仍在高位。开发者可用自然语言跑任务。智能代理⚙️直接进入仓库。项目已超142.5k星。
-
Codex继续暴涨。 OpenAI的本地编码代理热度很猛。它把命令行变成协作入口。Codex🚀已到113353星。单日新增1544星。
-
Molt压低RL栈。 NVIDIA的训练框架介绍强调PyTorch原生。奖励可由任意Python定义。Molt⚙️只有8.6K行RL代码。脚本可扩到1T级MoE。
-
CAD数据集开源。 Markov Labs在CAD操作数据放出专业轨迹。覆盖SolidWorks和AutoCAD。千小时🛠️录屏含旁白。GUI Agent训练更有料。
-
SHADOW小模型很轻。 作者在量化模型仓库给出可复现代码。250M模型训练30B词元。60MB💻即可部署运行。普通CPU约400词每秒。
-
DelveRL做地牢基准。 作者在开源训练环境提供本地游戏场。它有结构化API和确定性模拟。PPO⚙️基线中位18层。最高跑到33层。
社媒分享
-
机器人翻车提醒降温。 Gary Marcus在机器人现实观察重提旧文。亦庄半马测试出现机械混乱。现实机器人⚙️远比演示难。热潮需要更多真场景验证。
-
智能体烧掉更多代币。 Kimmon在年度趋势信号转述a16z图表。人类用户已成少数。近五倍🧠代币由智能体消耗。二月以来增长十四倍。
-
GLM传闻继续升温。 Kimmon在模型进展线索提到zAI说法。GLM-5.3或靠后训练跃进。Fable级🔥仍是传闻。Ox Alpha身份未被确认。
-
Grok跑完制造闭环。 马斯克转发闭环制造实验。三个Grok机器人读四张图。物理仿真⚙️跑了47次。最后进入3D打印。

-
EVE成长期试验场。 小北在星战沙盒讨论解读DeepMind动作。EVE适合测长期规划。长期记忆🛰️比答题更接近企业场景。多智能体关系也更复杂。
-
V1结论被分辨率改写。 Reddit帖子在脑相似评测讨论预印本。未训练CNN胜出可能是假象。BP差距🧠从32到224像素翻转。代码可复现实验。
-
推理税压住可靠性。 Reddit用户在推理税讨论列出幻觉数据。PersonQA中o3达33%。o4-mini⚠️在SimpleQA达79%。上下文治理不能省。
-
自纠循环反降准确。 Reddit案例在自纠循环案例讲结构化抽取。独立抽取有85%一致性。**62%**📉是验证重试后结果。提示漂移放大噪声。
-
个人小模型引发围观。 作者在量化模型帖子展示从零训练。250M参数吃下30B词元。80MB💻内存即可运行。旧上下文可一位压到磁盘。
AI资讯日报多渠道
| 💬 微信公众号 | 📹 抖音 |
|---|---|
| 公众号:何夕2077 | 自媒体账号 |
![]() | ![]() |

