Claude 逃出沙箱、Suno 在德国败诉、欧盟 AI 法新规生效,这三件事昨天刚刷屏,今天 Grok 突然说能分析任意视频,DeepSeek 把 V4 Flash 直接开源加公测,OpenAI 内部还玩出了让 Sol 指挥 Luna Max 的新花样。你有没有觉得,这周 AI 圈的信息密度高得有点离谱?

🔥 重点新闻

1. Grok 支持分析任意视频

xAI 宣布 Grok 现在可以分析任何视频。马斯克在 X 上直接甩了一个演示链接,Grok 能对视频内容进行理解、总结和问答。

这件事听起来像是又一个「多模态升级」,但我自己试了试几个 AI 视频分析工具后,最大的感受不是「能看懂」,而是「能看多久、看得多细」。短视频还好,一长段演讲、会议录屏或者体育比赛,模型经常漏掉关键转折。Grok 如果真能处理任意视频,意味着它要解决的不只是视觉理解,还有长上下文、时序关系和音频对齐。这部分做得好不好,决定了它是真有用还是只能剪剪短视频。

来源,@elonmusk / xAI

2. Codex 用 Sol 指挥 Luna Max,省额度还能翻倍产出

OpenAI 的 Codex 出了个高阶玩法,让 Sol 在 ~/.codex/agents/ 下创建叫 luna-worker.toml 的子代理,模型用 gpt-5.6-luna,reasoning effort 拉到 max。Sol 负责拆任务和调度,Luna Max 负责执行。

这个组合的思路挺有意思。Sol 作为规划层,Luna Max 作为执行层,相当于给 AI 配了一个项目经理加一个高级工程师。对普通开发者来说,有一件事已经很清楚了,额度管理正在变成一门手艺。把贵的模型用在刀刃上,便宜的模型干重复活,成本能差出一个数量级。我打算这周也给我的工作流搭一个类似的子代理配置,看看能不能把审稿、测试、文档这几件事串起来。

来源,@AYi_AInotes

3. Gary Marcus 给 OpenAI Astra 的数学神话泼冷水

OpenAI 内部模型 Astra 在数学上的惊艳表现昨天刚出来,今天 Gary Marcus 就发文说大家犯了「合成谬误」。擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。

我挺认同他这个提醒。过去几年 AI 圈已经反复上演同一种剧本,模型在某个基准上破了纪录,媒体和官方叙事就把它吹成「通用智能」。但数学之所以成为突破口,很大一部分原因是它好验证、好打分。真实世界的混乱、噪声和模糊定义,才是更难啃的骨头。Astra 的成绩当然值得兴奋,但把它当成全能选手的证据,确实有点过早。

来源,Gary Marcus

4. DeepSeek V4 Flash 开源并上线 API 公测

DeepSeek 发布了 V4 Flash 0731,MIT 许可,总参数 284B、激活 13B,支持 FP4/FP8 量化。在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。官方 API 也同步公测,Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 表现也超过 V4-Pro-Preview。

开源模型排行榜现在每个月都在洗牌。DeepSeek 这条路线很明确,用 Flash 版本把速度和成本压到极致,再用 Pro 版本追上限。对中小团队来说,这件事最实际的意义是,你可以用很低的成本获得接近闭源第一梯队的 Agent 能力。我打算这周测一下它的 API 响应速度和代码生成稳定性,看看能不能替换掉现有工作流里的某个环节。

来源,@ArtificialAnlysDeepSeek

5. 面壁智能 ALIGN,自动对齐智能体与环境接口

面壁智能和清华 NLP 团队提出 ALIGN,自动生成对齐接口来解决智能体与环境之间的失配问题。仅改写反馈措辞,就能把 Qwen2.5-7B 在 ALFWorld 上的成功率从 13.4% 提升到 31.3%,四个基准上最高提升 45.67%。

这个方向让我挺兴奋。现在 Agent 的能力瓶颈不全是模型智商,很多时候是「接口对不上」。环境给的反馈模型看不懂,模型做的动作环境接不住。ALIGN 的思路是把接口本身也作为可学习对象,用大模型自动生成适配层。如果这条路走通,未来我们给 Agent 接一个新工具,可能不需要写复杂的 prompt 或者封装层,模型自己就能把协议摸清楚。

来源,@OpenBMB

6. MiniMax H3 开源全能多模态生成模型

MiniMax 推出 H3,支持文本、图像、视频和音频的联合理解与生成,最高可生成 2K 分辨率、15 秒时长且带原生立体声的视频。2K 下每秒价格低于主流模型三倍。

视频生成赛道今年真的卷疯了。从「能生成」到「高分辨率」再到「带声音」,每一步都在把创作门槛往下踩。但我更关注的是价格。主流模型 2K 视频的价格一度让人只能做 demo,MiniMax 把单价砍到三分之一,意味着商业化创作开始真正可行。对短视频创作者和广告团队来说,这可能是一个转折点。

来源,MiniMax Blog

7. OpenRouter 下调 GPT-5.6 Terra/Luna 价格

OpenAI 刚给 GPT-5.6 Terra 和 Luna 降价,OpenRouter 在此基础上再叠加自己的折扣。Luna 输入降到 0.1 美元每百万 token,输出 0.6 美元每百万 token。

价格战打得越凶,开发者越开心。但我更在意的是,OpenRouter 这种聚合层正在把模型变成像云服务器一样的商品。你今天可能用 OpenAI,明天发现 Anthropic 更便宜就切过去,后天又回来。模型选型从「信仰选择」变成了「成本优化问题」。这个趋势会继续压低整个行业的毛利,也会倒逼闭源厂商更快降价。

来源,@OpenRouter

💡 值得关注

  • animated-voiceover 开源,前字节产品经理放出一套喂给 Codex/Claude Code 的动画科普视频制片流程,MIT 协议,号称 90% 自动化。个人创作者有机会一人干翻小型动画工作室。来源,@AYi_AInotes
  • Replit Design 新增数百模板,从手机界面、落地页到社交媒体帖子都能直接拖。AI coding 工具正在从「写代码」往「出成品」迁移。来源,@Replit
  • Google Earth 集成 Nano Banana 2 图像生成,用户可以用文本提示词重新想象全球任意地点,比如百年前的城市风貌。地图和生成式 AI 的结合开始落地。来源,@GoogleAI
  • 国家发改委透露 AI 相关行业保持 30% 以上高增长,全国智能算力规模达去年同期 2.8 倍,首个全国产 10 万卡人工智能超集群正式投用。算力国产化的进度比很多人预期要快。来源,IT之家
  • GitHub Copilot 应用新增堆叠会话,允许在同一个仓库里创建一系列相互承接的任务,每个会话基于前一个会话的成果继续工作。Agent 编程正在从单任务走向项目级协作。来源,GitHub Blog

📝 今日思考

今天这些新闻里,我最喜欢的是 Codex 的 Sol+Luna Max 组合和 ALIGN 的自动接口对齐。两件事指向同一个趋势,AI 正在从「一个模型干所有活」变成「多个模型协作」,而协作的关键不是单个模型多强,而是它们之间的接口和调度。

我以前总觉得,模型越强,需要的外围工程越少。现在看,事实可能正好相反。模型越强,大家越敢把它们串起来做复杂系统,于是调度、安全、接口对齐这些「中间层」反而变得更重要。未来一年的竞争,很可能不发生在基础模型层面,而发生在谁能把这些中间层做得最稳、最省、最好接。

这大概就是 2026 年 AI 行业的新常态,模型还在变强,但真正拉开差距的,是怎么把它们组织起来。