Sam Altman 在凌晨发了一条推文,说 OpenAI 刚刚发布了他们「有史以来最好的模型,也是写得最好的博文之一」。我没忍住,点进去看了眼。

GPT-5.6 来了。

名字很低调,但信号很清晰,AI 这班列车还在加速,没人想先下车。今天刚好也是这半年来科技圈最热闹的一个周五,模型、官司、机器人、开源项目全挤在一起了。

🔥 重点新闻

1. OpenAI 发布 GPT-5.6,Sam Altman 称其为史上最佳

OpenAI 官网发布了 GPT-5.6 的博文,Sam Altman 在 X 上直接定性这是他们「有史以来最好的模型」。

说实话,这种话我已经听好几家了。但每次听到,我还是会好奇,这次的「最好」到底是真升级,还是又一次营销话术。从博文里能读出来的信息是,OpenAI 明显在推「智能体工作流」和「可操控性」这两个方向,模型不再只是回答问题的聊天工具,而是要真正嵌入到工作流里。

我自己用 ChatGPT 的感觉是,它的上限越来越高,但日常任务的边际收益在递减。GPT-5.6 能不能让我重新感到惊艳,可能取决于它在代码、长文档和跨工具协作上的表现,而不是单纯的 benchmark 分数。

来源,OpenAI 官网Sam Altman X

2. 苹果起诉 OpenAI 窃取商业机密

就在 OpenAI 发新模型的同一天,苹果向美国加州北区法院起诉了 OpenAI,指控其窃取商业机密并违反合同。诉状里提到,OpenAI 高管被指使前苹果员工在招聘过程中泄露机密,包括未发布产品的项目代号。

这事儿听起来像电视剧,但在硅谷其实一点也不新鲜。大模型公司抢人抢得凶,带出来一点「前东家的东西」往往很难界定。苹果这次选择硬刚,说明它真的急了。

你想想看,苹果自己的 Apple Intelligence 推进得并不算快,而 OpenAI 不仅在模型上领先,还可能通过挖人拿到了苹果内部的产品路线图。这官司一打,后面估计会扯出更多邮件和聊天记录。

来源,TechCrunch

3. 马斯克罕见承认,Anthropic 才是当前 AI 领导者

Elon Musk 在 X 上发文,承认自己之前对 Anthropic 的判断错了,说 Anthropic「显然是当前 AI 领域的领导者」。他还特别提到 Mythos 和 Fable 这两个模型,并预测 Mythos 2 很快会出来。

这话从 Musk 嘴里说出来,我挺意外的。他一向是谁都不服,怼天怼地。能让他公开低头,说明 Anthropic 最近确实把他打服了。xAI 的 Grok 和马斯克收购推特后的一系列动作,本来是想在 AI 战场里占一席,但现在看来,Anthropic 在模型质量和企业市场上都走得更稳。

我跟你说,这不仅仅是面子问题。Musk 的表态会影响资本市场对各家 AI 公司的估值判断,也会让 Anthropic 在后续融资和招聘上更有话语权。

来源,X / rohanpaul_ai

4. 扎克伯格回应 Meta「算力过剩」,说租出去更赚钱

Meta CEO 扎克伯格首次正面回应了公司筹划云基础设施业务的传闻。他否认了「算力过剩」的说法,说内部需求依然旺盛,满负荷运转。但话锋一转,他说现在市场对算力出价极高,把一部分 AI 基础设施对外出租在财务上更划算。

这个逻辑其实挺有意思。Meta 不是 AWS,也不是 Google Cloud,但它手里握着全球最大的 AI 训练集群之一。如果能把闲置或者可腾出来的算力租给别人,确实是一笔好生意。

不过你想想看,这也说明一个问题,即便是 Meta 这种级别的巨头,也在算力投资上感到了压力。自建数据中心越来越像一场军备竞赛,大家都想知道怎么才能把沉没成本变成现金流。

来源,IT之家

5. 宇树 G1 人形机器人完成首例活体微创手术

《自然》杂志发表了一篇论文,加州大学圣地亚哥团队用宇树 G1 人形机器人完成了首例活体标准微创手术。两只活猪接受了腹腔镜胆囊切除,第二次手术只用了 32 分钟。

看到这个消息,我第一反应不是「机器人要取代医生了」,而是「这一步比想象中来得快」。手术机器人之前都是达芬奇那种固定机械臂,现在人形机器人直接站上手术台,用常规器械操作,意义完全不一样。

当然,研究团队也说了,机器人还需要反复校正,目前还不能满足临床应用标准。但这件事让我意识到,人形机器人的应用场景可能不只是工厂和展厅,医疗可能是下一个真正的高价值场景。

来源,Nature / thexpin

6. 美团 LongCat-2.0 开源,1.6 万亿参数专为 Agentic Coding 设计

美团正式开源了 LongCat-2.0,总参数 1.6 万亿,平均激活约 480 亿。这个模型最大的特点是专门为真实的 Agentic Coding 任务设计,引入了稀疏注意力机制和 N-gram Embedding 来提升长上下文处理效率。

国内大厂开源大模型已经不是新闻了,但美团这次的方向很具体。它不是做一个通用聊天模型,而是瞄准代码智能体这个赛道。这说明美团内部在代码生成、自动化编程方面已经有真实需求,才会选择把这个模型开源出来。

另外,同步开放国产卡推理代码这件事也很值得关注。算力自主化是国内 AI 公司必须面对的课题,能在国产卡上跑起来的模型,才会真正被大规模采用。

来源,美团 LongCat 公众号

7. 小红书发布大模型新架构 PIPO,输入减半输出翻倍

小红书技术团队提出了 PIPO 架构。思路挺巧妙,输入侧用一个压缩器把两个 token 折叠成一个 latent,输出侧再用 MTP head 把隐藏状态展开成额外 token。结果是输入长度减半,每步输出翻倍。

这种架构创新比单纯堆参数更有趣。它试图解决的是大模型推理中的效率问题,同样算力下能处理更长的上下文,生成速度也更快。基于 Qwen3.5-4B 和 9B 做 backbone,说明它更偏向实际落地,而不是炫技。

我觉得这类工作会慢慢成为主流。模型参数竞争到后面,边际收益越来越低,如何在推理效率和长上下文上取巧,才是接下来一年的关键战场。

来源,小红书技术公众号

💡 值得关注

  • Claude Code 桌面版新增应用内浏览器,可以直接在 Claude 里打开文档、设计稿和网页,像操作本地开发服务器一样交互。对前端开发者来说,这可能会减少很多来回切换窗口的时间。来源,ClaudeDevs

  • OpenAI 推出 ChatGPT Work,一个能跨应用和文件收集信息、把复杂项目分解执行并持续工作数小时的 AI 智能体。目前每周已有超过 500 万用户使用 Codex,其中超 100 万用于非软件开发。来源,OpenAI 官网

  • DeepSeek-V4 Flash 强化学习训练登陆 AMD MI355X GPU,基于 ROCm 软件栈运行。2840 亿参数的 MoE 模型能在 AMD 生态上跑 RL,对国产和替代算力方案是个积极信号。来源,LMSYS Blog

  • Cognition 发布 SWE-1.7,基于 Kimi K2.7 训练,号称接近 GPT-5.5 和 Opus 水平。软件工程智能体的竞争越来越卷了。来源,Hacker News

  • 微软发布 Flint,一种面向 AI 智能体的可视化中间语言,让智能体通过简洁 spec 自动生成图表,支持 46 种图表类型。来源,Hacker News

  • Mistral 推出 Studio,为提示词和技能提供集中式系统记录,支持版本、回滚、审计日志。企业级 AI 治理工具越来越重要了。来源,Mistral AI

📝 今日思考

今天这一堆新闻看下来,我有一个挺强的感受,AI 行业正在从「秀肌肉」转向「做生意」。

OpenAI 发新模型、苹果打官司、Meta 想出租算力、马斯克低头承认对手更强,这些事的背后都是同一个问题,投入这么巨大,到底怎么回本?红杉之前算过一笔账,2026 年全球 AI 基础设施投入可能达到 1.5 万亿美元,行业需要产生 3 万亿美元收入才能回本。这个 3 万亿的问号,到现在还没人能给出一个确定答案。

但反过来看,宇树的机器人进了手术室,美团的模型在国产卡上跑了起来,小红书在推理效率上做架构创新。这些具体而扎实的进展,可能比任何豪言壮语都更接近那个答案。

Sam Altman 说 GPT-5.6 是他们最好的模型。我信,但更好奇的其实是,接下来的半年里,我们能不能看到它真正改变某个行业的日常工作方式。

模型本身已经不那么稀缺了。稀缺的是,把它放进真实场景里还能站稳的能力。