AI日报 | 2026年07月09日
OpenAI 和 xAI 像是约好了一样,今天同时把牌桌掀了。
GPT-5.6 全量上线、Grok 4.5 正式发布,这还没完,Mistral 端出了机器人导航模型,Cognition 的 SWE-1.7 直接说「我们和 GPT-5.5 差不多了」。
一天之内,模型层、Agent 层、硬件层全在动。
我跟你说,这已经不是「热闹」能形容的了,感觉整个行业都在抢一个东西,谁能先把「通用智能」从 PPT 里抠出来,谁就是下一轮赢家。
🔥 重点新闻
1. GPT-5.6 本周四全量上线,OpenAI 还顺手发了 GPT-Live
OpenAI 今天把 GPT-5.6 推给了所有用户。我一开始以为是常规更新,但看了能力边界之后,觉得这事可以多说两句。
来源,36kr 报道称,GPT-5.6 在推理一致性和长上下文稳定性上有明显改进,而不是简单堆参数。换种说法,它更像是在解决「前面答得挺像回事,后面突然开始胡说」的问题。这个痛点估计很多人用过 ChatGPT 都碰到过。
更让我意外的是 GPT-Live。来源,OpenAI 官方博客把这个功能定位为实时语音和视频助手,延迟压到很低,语气也更自然。坦率的讲,去年大家还在争论语音是不是伪需求,今年各家都已经把多模态实时交互当成主战场了。
2. Grok 4.5 正式发布,马斯克终于不再藏着掖着
xAI 的 Grok 4.5 来了。来源,xAI 官方博客,新版本在数学、代码和推理上都有提升,马斯克这次罕见地直接跟 OpenAI 正面撞车。
我觉得这很有意思。Grok 之前的定位有点模糊,一会儿是「推特幽默感」,一会儿是「长文本」。但 4.5 开始,它明显是在往「严肃工具」方向靠。这说明什么?说明马斯克也看明白了,聊天机器人的噱头期过了,现在要比的是谁能真的帮你解决复杂问题。
不过 Grok 的落地场景还是太依赖 X 平台。能不能破圈,可能不是技术问题,而是产品问题。
3. Mistral 发布 Robostral Navigate,机器人导航模型
Mistral 这次没卷大语言模型,而是转向了机器人。来源,Mistral 官方博客,Robostral Navigate 是一个机器人导航模型,能让机器人在复杂环境里自主规划路径。
这块我关注有一段时间了。大模型在语言上卷完之后,视觉-动作-导航这个方向会越来越重要。Mistral 的选择很聪明,躲开正面战场,去啃一个工程上更难、但竞争没那么惨烈的方向。
如果它能在真实机器人上稳定运行,这个模型的价值可能比另一个 70B 语言模型更大。
4. Cognition 的 SWE-1.7 声称接近 GPT-5.5 和 Claude Opus 智能水平
Cognition 今天发了 SWE-1.7。来源,Cognition 博客,官方说它在软件工程任务上达到了接近 GPT-5.5 和 Claude Opus 的水平。
我第一反应是,这真的假的?毕竟 Cognition 之前靠 Devin 赚足了眼球,但实际用起来没那么神。不过 SWE-1.7 的打法不太一样,它更垂直,只盯着软件工程这个场景。来源,HN 上这条讨论热度很高,说明开发者群体确实在认真看。
垂直 Agent 超过通用模型,这件事如果成真,对行业的冲击会很大。以后可能不是「一个大模型打天下」,而是每个领域都有一个专门干活的 Agent。
5. 全球首个超高帧世界模型诞生,50 帧,英伟达含量为 0
来源,36kr 报道,有一款新的世界模型实现了每秒 50 帧的生成速度,而且完全没有用英伟达硬件。这消息听着有点离谱,但如果是真的,那意义不小。
世界模型之前最大的瓶颈就是慢。Sora 那种效果惊艳,但生成一帧都要等很久。50 帧意味着它可能真的可以实时生成可交互环境,游戏、仿真、机器人训练都会受影响。
英伟达含量为 0 这个点更值得玩味。过去大家默认做 AI 离不开英伟达,但现在越来越多项目在尝试绕过它。这个趋势会不会变成长期格局,我还不敢下结论,但至少说明替代方案正在成熟。
6. 工信部首次定调,Claude Code 危害严重
来源,36kr 报道称,工信部在一份文件里把 Claude Code 的危害性定得比较重。这个事我仔细看了原文,核心不是否定 Claude Code,而是对「代码自动生成」的安全性和可控性提出警告。
这个信号很重要。Agent 写代码的能力越来越强,但监管还没跟上。工信部的定调可能是一个开始,接下来企业级市场对代码 Agent 的采购会更谨慎。
对开发者来说,这不是坏事。工具越强大,使用责任也越大,提前建立规范总比出事之后再补课强。
7. 字节花了 3.8 万小时,发现 Agent 的 Scaling Law
来源,36kr 报道,字节跳动的一个团队投入了 3.8 万小时 GPU 训练时间,专门研究 Agent 的 Scaling Law。这数字听着就烧钱。
他们的结论是,Agent 的性能 scaling 不仅和模型大小有关,还和任务分解、工具调用、反思机制强相关。坦率的讲,这有点反直觉。之前大家以为只要模型够大,Agent 就会自然变强,但事实证明,Agent 的架构设计可能和模型本身一样重要。
这对行业的影响是,接下来 Agent 创业公司不能只靠「套壳 GPT」了,得有真正的系统工程能力。
8. DeepSeek 和智谱被曝造芯,专攻推理
来源,36kr 报道,DeepSeek 和智谱都在秘密做芯片,方向聚焦推理,据说一年前已经启动。
这个消息不意外,但时间点很有意思。大模型价格战打到现在,推理成本已经成为核心竞争力。自己做芯片,能把成本压到别人做不到的程度。DeepSeek 之前靠工程优化已经打出了性价比,如果再掌握硬件,那优势会进一步放大。
智谱走这条路也合理。它现在的处境是被巨头夹击,必须找到差异化的护城河。自研芯片是最重的选择,但也是最深的护城河。
💡 值得关注
竞赛编程 Agent 进入全球前十,南大、清华新模型 CF rating 超 3500。来源,36kr。这说明在特定细分领域,Agent 已经超过绝大多数人类选手了。
大厂集体下架 AI 聊天机器人。来源,36kr。不是产品不好,而是找不到盈利模式,C 端聊天机器人可能正在进入洗牌期。
腾讯放手,AI 没有大哥。来源,36kr。腾讯在 AI 上的策略变得比以前更务实,不再追求全面领先,而是找能赚钱的场景。
支付宝 AI 战略全貌逐渐清晰。来源,36kr。蚂蚁把 AI 嵌进支付和生活服务,走的是「工具化」路线,而不是「对话产品」路线。
📝 今日思考
今天这堆新闻看下来,我发现一个规律。
上半年大家还在比谁家的模型分数高,下半年已经开始比谁家的模型能落地。Agent、机器人、世界模型、自研芯片,这些全是「落地」相关的方向。
坦率的讲,这对我来说是个提醒。作为开发者,追新模型当然重要,但更重要的是想清楚,这个新能力能帮我解决什么具体问题?如果答不上来,那再强的模型也只是新闻。
模型层面的战争还没结束,但应用层面的战争,已经打响。




