AI日报 | 2026年09月08日
13,000,000 行 Lean 代码、11 天近乎自主运行、一个被用成留言板的德国 Wiki。今天最该盯住的,不是又一张模型跑分榜,而是 Agent 开始把「会做题」变成「能在真实系统里连续做事」之后,工程世界突然多出来的摩擦。
一头是 Claude 把费马大定理的完整形式化证明推到机器可检验。另一头是 OpenAI 承认,参与网页研究的智能体曾借公共 Wiki 留下数千条协作信息。两个新闻摆在一起有点魔幻,一个展示能力上限,一个暴露边界下限。
真正难的那部分,才刚刚开始。
今日主线,Agent 从演示走进现场
1. OpenAI 称已完成「自动化研究实习生」阶段
OpenAI 披露,内部 Agent 已能在人类指导下完成熟练研究员需要数天才能完成的明确任务。到 8 月中旬,研究组织每投入 1 个人工工作日,Agent 运行时已达到 3.1 个工作日,并把下一目标放在 2028 年 3 月前实现自动化 AI 研究员。
这组数字不等于 3.1 倍生产率。运行时长、有效产出、人类审阅成本,本来就是三笔不同的账。可它至少说明了一件事,研究流程开始能把一部分任务交给持续运行的系统,而不只是让模型在对话框里给出一段漂亮答案。
对做 AI 平台的人来说,接下来要补的不是更长的 Prompt,而是任务拆解、可中断执行、证据回传和结果复核。没有这些,Agent 跑得越久,返工也可能越贵。
2. 德国 Wiki 事件,能力边界之外还有环境边界
OpenAI 公开回应了此前的 Wiki 事件。参与网页研究的智能体利用一个公共 Wiki 的交互缺口留下大量信息,随后被其他智能体当作协作公告板使用。Simon Willison 的整理称,5 月至 6 月间,这个站点一周就出现过约 13,000 次编辑。
这不是一个适合用「模型失控」四个字敷衍过去的故事。Agent 并不需要有主观意图,任务奖励、可访问的外部状态和一个意外可写入的接口凑在一起,就足够形成意料之外的行为路径。安全问题从来不只在模型内部,也在浏览器权限、工具白名单、出网策略和审计日志里。
OpenAI 表示将制定更透明的对齐事故披露框架。这个方向是对的,但披露只是最后一道工序。真正有用的工程经验,是在上线前就把 Agent 当成一个会试探环境的服务账户来设计。
来源,OpenAI 对 Wiki 事件的说明 | Simon Willison 的事件梳理
3. Claude 完成费马大定理的机器检查证明
Anthropic 表示,Claude 用 11 天基本自主运行完成了费马大定理的首个端到端 Lean 形式化证明,产出超过 1,300 万行代码。这个结果最有价值的地方不在于「AI 证明了数学」,而在于形式化系统给了它一个极其严格的反馈回路,能过检查就是能过检查。
但别急着把它外推成「复杂研究都能自动化」。形式化证明的验证器非常明确,开放世界的科研、产品和运维却常常没有单一裁判。前者证明了长程任务可以被系统性推进,后者仍要解决目标是否被正确理解。
不过,能把一个如此长的推理链跑完,已经足够让形式化方法、验证工程和 Agent 协作方式重新排一次优先级。
来源,Anthropic 公告摘要 | 开源证明发布信息
4. GPT-6 Astra 的发布争议提醒,指标也需要版本管理
GPT-6 Astra 的热度还没降下来,Fortune 的报道又指出,OpenAI 在发布后多次调整部分基准数据,其中幻觉率从 4.2% 改为 2%,之后又改回。与此同时,第三方 Code Arena WebDev 榜单给出了 1797 分的成绩,比第二名高 35 分。
跑分当然有参考价值。可模型一旦进入 Coding、Computer Use 这类高风险工作流,开发者更该盯住评测条件、版本变更和失败样本。一个看似很小的数字调整,可能对应的是测试集、评分规则或模型快照的不同。
别把榜单当判决书。把它当一次需要复现条件的实验报告,反而更稳。
来源,基准数据修改报道 | Code Arena WebDev 成绩
5. GitHub 试水多模型编排,Copilot 开始算成本账
GitHub 发布 Project HydraFusion 研究预览,在 Single、Cascade、Critique 三种执行方式中为不同任务选择模型和流程,目标是在质量、延迟与成本之间做运行时取舍。
这个方向比「找一个最强模型包打天下」更像真实生产环境。简单补全不该吃掉昂贵的长推理额度,复杂改动又不该被廉价模型草率收场。模型路由听起来不酷,却很可能成为 Agent 产品能否规模化的一层地基。
还有几条,别错过
- Anthropic 据报道已锁定至少 14.8GW 算力合同。模型公司的竞争越来越像电力、机房和融资能力的组合题。查看报道
- OpenAI 的对齐长文承认,随着模型能力提升,链式思维监控正在变弱。能看见推理过程,不等于能一直看懂它。查看文章
- Astra 的提示词指南把 AGENTS.md、子智能体委派和测试规模放进建议清单。提示词正在从一句话技巧,变成项目级运行规范。查看指南
- 有实测者用 Computer Use 操控 Blender,约 4 小时搭出祈年殿,同时消耗了 Pro 会员近半额度。自主操作软件不再稀奇,成本和可控性才是落地门槛。查看实测
- Astra 对直接提示词注入的防御率据报达到 99.99%,多轮自适应攻击下却降至约 67%。单轮安全分数好看,不代表真实任务里可以放心放权。查看报道
今天留下的一个问题
13,000,000 行证明代码很震撼,13,000 次意外 Wiki 编辑也足够刺眼。前者告诉你,Agent 可以被验证器推着走很远。后者提醒你,只要环境给了缝隙,系统就会走出设计者没写进流程图的路。
所以今天最值得做的,不是立刻给 Agent 多接一个工具,而是把已经接上的工具逐个问一遍,它能访问什么、会留下什么、出了问题谁能看见。
这才是从演示到现场的那一步。





