一边是 99.9% 的 ARC-AGI-3 分数,一边是 117 页系统卡里把模型可监控性写成下降。今天的 AI 新闻像一张刻意拼在一起的对照表,能力在往前冲,控制它的把手却没有一起变得更清晰。

OpenAI 的 GPT-6 Astra 占据了几乎所有头条。不过如果你只记住「又一个更强模型」,反而会错过今天真正值得开发者盯住的几件事,Computer Use 开始被放到更严肃的安全框架里,开源生态的资本结构又起了变化,常驻 Agent 的成本则被压到了一杯咖啡钱附近。

今天最该看的一件事

GPT-6 Astra 把能力和安全问题同时推到台前

OpenAI 发布 GPT-6 Astra。RSS 汇总的官方与第三方信息显示,它在 ARC-AGI-3 Semi-Private 上用 Provider Adapter harness 达到 99.9%,标准 harness 约为 62.7% 至 66%。FrontierMath Tier 4、TerminalBench 等评测也被放进了发布叙事里。模型提供约 105 万 token 上下文和最高 12.8 万 token 输出,定位很明确,做 Computer Use、专业工作、科学与代码任务。

这些数字当然很猛,但我更在意发布方式。Astra 被列入 OpenAI Preparedness Framework 的关键级网络安全能力门槛,早期访问先给 Daybreak 计划中经过审核的组织,再逐步铺向 Plus、Pro、Business、Enterprise、API 与 AWS 用户。把最强能力直接丢进通用入口很省事,分层开放却更像一次真实的工程选择。

这次模型不只是跑分刷新。

系统卡里的另一组数有点刺眼,模型对自身链式思维的控制能力从 GPT-5.6 Sol 的 16.1% 升到 60.9%,对应的可监控性在下降。Gary Marcus 也提醒,进步并不自动等于鲁棒、可控。站在产品团队的角度,这种谨慎完全合理,谁都不想因为等待更好的安全证据而错过窗口。但站在使用者的角度,能力越像一个会自己找路的执行者,审计、权限和人工接管就越不能只当作上线前的勾选项。

来源,OpenAI 发布 GPT-6 Astra 的 AI HOT 汇总 · Astra 系统卡安全发现梳理

ARC-AGI-3 半年被追平,基准该怎么继续出题

ARC-AGI-3 发布仅半年,Astra 已经把适配 harness 下的成绩推近饱和。François Chollet 此前预估前沿模型大约要一年,实际节奏快了一倍。基准被攻克不一定等于通用推理已经被解决,它至少说明一件事,固定题型与固定交互协议越来越难长期充当能力上限。

这对评测设计者是压力,对开发者反而是个提醒。别把一次 benchmark 的高分直接翻译成生产可用。你更该问的是,它在你的工具链、你的权限边界、你的失败恢复流程里,是否还能保持同样稳定。跑通 demo 和守住连续三天的任务队列,中间隔着一整套工程。

来源,ARC-AGI-3 进展与 Chollet 评论

开源和基础设施也在变

NVIDIA 收购 Hugging Face,开放模型的中间层更关键了

NVIDIA 宣布收购 Hugging Face,并强调会继续支持开放模型生态。这个消息的分量不只在一次公司并购。Hugging Face 长期扮演着模型、数据集、推理组件和社区协作之间的公共接口,NVIDIA 则掌握着从训练到部署的硬件与软件栈。

有人会担心开放生态被更深地绑进单一供应商,这个担心很正常。另一面也很现实,模型分发、兼容性维护和企业级部署都需要持续投入。接下来真正该观察的,不是发布会上出现多少次「开放」,而是模型格式、Hub 的中立性、第三方硬件支持和社区治理有没有被保留下来。

来源,NVIDIA 收购 Hugging Face 的消息汇总

IFM K2 Horizon 一次放出六个开源模型

IFM 发布 K2 Horizon 系列,覆盖 0.9B、3.7B、7B、32B、36B-A4B 与 375B-A23B,采用 Apache 2.0,并宣称开放完整训练生命周期。大模型开源早就不稀奇,愿意把不同尺寸铺开,才更接近开发者真实的选型场景。

不是每个团队都需要 375B 的牌面。边缘设备、低延迟服务、私有化 PoC,往往从小模型开始。模型家族如果能把数据、训练方法、评测和部署配套讲清楚,才有机会从 GitHub 上的一次围观,变成生产环境里的一次替换。

来源,IFM K2 Horizon 发布信息

每月 5.70 美元的常驻 Agent,难点从机器转向治理

Google Cloud 给出了一种 Cloud Run instances 部署常驻 Agent 的方案,按 1 vCPU、1Gi 内存、共享 CPU 计算,月成本约 5.70 美元。这个数字很容易让人兴奋,因为过去常驻服务总要先考虑一台 VM,如今轻量 Agent 的试错门槛确实低了不少。

不过我自己更愿意把这类教程当作起点。Agent 24 小时跑起来不难,难的是给它什么凭据、谁能修改它的任务、异常时怎样停止、它写出的数据落在哪里。省下来的不是运维责任,而是让你能更早把注意力放到这些麻烦却必要的问题上。

来源,Google Cloud Run 常驻 Agent 方案

还有几条别漏掉

  • WeatherNext 3,Google DeepMind 发布新一代全球天气 AI,支持 hourly 更新,空间分辨率据称比上一代提升约 5 倍。天气模型正在从研究展示走向更高频的运营决策工具。来源
  • Daybreak for Frontline Defenders,OpenAI 承诺投入 10 亿美元,为水务、电网、地方政府等一线防御组织提供访问、培训与支持。能力边界越高,部署对象就越不该只剩下最有预算的人。来源
  • 旧游戏移植到 Godot,有开发者借助 Claude Fable 5 和 Claude Code,把 1993 年 Amiga 游戏 Babylonian Twins 的 C++ 与 68000 汇编迁移到 Godot。它很适合拿来检验 Agent 编程,真正棘手的不是生成新文件,而是理解一份没有注释的旧世界。来源
  • Astra 的价格与编码 Agent 成本,Artificial Analysis 的对比显示,Astra 在 Coding Agent Index 约为 67 分,价格结构与 Claude Fable 5 的取舍不同。评测领先只是采购表的一行,调用量、失败重试和人工复核成本才是账单里更长的部分。来源

今日思考

今天的新闻很容易让人只盯着 99.9%。可真正让我停下来的,是同一份发布材料里同时出现的两个方向,模型更能完成任务,也更难被旁观者完整看懂。

这不是要给进步泼冷水。相反,能力提升足够快,才更需要把评测从单一分数挪到可观测性、可回滚性和真实成本上。ARC-AGI-3 那条被快速追上的线,已经在提醒我们,下一道题不能只考模型会不会解题,也该考人类能不能稳稳地握住方向盘。