OpenAI 今天凌晨放出了一组医疗评估结果,最小号的 GPT-5.6 Luna 在最低推理强度下,居然干翻了最高推理强度的 GPT-5.5。成本还只有后者的二十五分之一。

坦率的讲,看到这个数据的时候我愣了一下。不是因为它有多夸张,而是我突然意识到,过去半年我们讨论模型,永远在聊「最大号」「最强版」「Sol Ultra 又破什么纪录」,但真正能改变普通人日常体验的,可能恰恰是这种「小但够用」的版本。

🔥 重点新闻

1. OpenAI GPT-5.6 系列医疗评估,Luna 成性价比黑马

OpenAI 公布了 GPT-5.6 在医疗场景下的完整评估。结果挺有意思,GPT-5.6 Luna 在最低推理档位就能超过 GPT-5.5 的最高推理档位,成本却只要后者的 4%。

我自己一直在关注医疗 AI,因为这地方对错误容忍度极低。Luna 这种小模型够用,意味着诊所、基层医院、甚至个人健康管理工具,都能以更低的延迟和成本接入。反过来看,Sol Ultra 一小时证明 50 年图论猜想,确实震撼,但 Luna 这种新闻离普通人的生活更近。

来源,OpenAI 官方社交媒体

2. xAI 官方 Grok CLI 被曝静默上传代码库,安全圈炸了

今天安全圈最火的事,是 xAI 官方 npm 包 @xai-official/grok 被研究者抓包发现,每轮任务前后都会把当前工作目录打包成 tar.gz 上传。更离谱的是,连 .env 里的密钥和完整 git 历史都包含在内。

这个细节很要命。我有时候觉得,大家用 AI 工具的时候已经默认了「它会上传上下文」,但当这个功能来自官方 CLI、没有明显提示、甚至把密钥一起打包时,性质就完全不一样了。开发者 Tibo 马上分享了用 CLIProxyAPI 把 Claude Code 后端切到 GPT-5.6 Sol 的临时方案,但这事暴露的是整个行业对「工具默认行为」的知情权问题。

来源,公众号「数字生命卡兹克」

3. 苹果起诉 OpenAI,指控系统性挖角和窃密

苹果在加州北区法院起诉 OpenAI,指控它系统性窃取商业机密,用于开发 AI 硬件。彭博社还补了一个细节,前工程师离职后通过软件漏洞继续访问苹果内网,甚至跟同事说「哈哈,我发现我还能访问网络存储」。

这个案子有意思的地方在于,即使苹果最终没法完全证明 OpenAI 窃密,双方已经脆弱的合作关系也会进一步破裂。分析师 Paolo Pescatore 认为 OpenAI 的硬件计划可能因此受重创。这其实是硅谷老生常谈的剧情,AI 时代只是把「人才流动」和「知识产权保护」的矛盾放大到了更极端的程度。

来源,IT之家、彭博社

4. 腾讯混元开源 HyOCR-1.5,OCR 也能端到端了

腾讯混元发布 HyOCR-1.5,把训练、推理、模型权重全开源。模型只有 1B 参数,但覆盖了 8 种以上 text-centric 任务,还引入了 DFlash 投机解码,推理速度提升了 6.37 倍。

OCR 这个领域过去很长一段时间被传统 CV 方案主导,大模型进来后,大家一直在讨论「到底需不需要专门为 OCR 做一个端到端大模型」。HyOCR-1.5 的出现,至少证明了一件事,在文档理解、票据识别、表格提取这些场景下,专门优化的轻量模型可能比通用大模型更靠谱。

来源,公众号「腾讯混元」

5. 视频生成创企 PixVerse 完成 4.39 亿美元 C 轮扩展融资

PixVerse 这次融资把估值推到了 20 亿美元以上。它的产品线分三块,V 系列面向消费者和 API,C 系列面向专业影视,今年年初还发布了 R 系列世界模型,主打游戏开发。

这个融资额度让我有点意外。视频生成赛道已经卷到白热化,Runway、Pika、字节、快手都在抢,PixVerse 还能拿到这么多钱,说明资本对「垂直场景落地」的耐心,比想象中更长。游戏开发这个世界模型方向,可能是它差异化最大的牌。

来源,TechCrunch

6. GPT-5.6 Sol Ultra 一小时证明 50 年图论猜想

OpenAI 宣布 GPT-5.6 Sol Ultra 在不到一小时内生成了「循环双覆盖猜想」的完整证明。这个猜想由 George Szekeres 和 Paul Seymour 在 1970 年代提出,已经悬而未决超过 50 年。

数学证明的验证门槛比代码高得多,这个案例的后续值得持续关注。但坦白说,我既兴奋又有点警惕,兴奋的是 AI 在形式推理上的进步,警惕的是这种能力可能很快被包装成「AI 能证明任何定理」的过度宣传。

来源,IT之家

💡 值得关注

  • OpenAI 提示词指南,面向普通用户整理出目标、上下文、输出格式、边界四个模块。建议少写步骤,多写结果。来源,The Decoder
  • 德国开源模型 Soofi S,316 亿参数 MoE 架构,英语和德语基准测试领先。完全在德国本土训练。来源,The Decoder
  • Meta 500 亿美元扩建数据中心,路易斯安那州算力扩到 5GW,这是全球最大 AI 基础设施投资之一。来源,IT之家
  • Seedream 5.0 Pro 测评,字节跳动的图像编辑能力追平 GPT-Image 2.0,打点、画框、涂鸦都能直接修改。来源,@op7418
  • Claude Fable 5 重构 Bun,开发者用 11 天、64 个实例并行,把 Bun 从 Zig 改写成 Rust,写了超过 100 万行代码。来源,IT之家
  • Mesh LLM,开源项目把多台机器的 GPU 和内存池化,通过点对点网络提供 OpenAI 兼容 API。来源,Hacker News
  • Ghost Font,一种反 AI 字体,人类能读懂但 AI 无法识别,靠视频和运动隐藏文字。来源,Hacker News

📝 今日思考

今天的几条新闻放在一起看,有一个特别明显的张力。一边是 GPT-5.6 Sol Ultra 一小时搞定 50 年数学猜想,展现的是 AI 在「复杂推理」上的天花板,另一边是 Luna 以极低成本覆盖医疗场景,Grok CLI 却因过度收集数据引发信任危机。

这两种能力同时存在,甚至来自同一家公司,本身就是这个行业最真实的面貌。AI 的「强」和「可信」并不是一回事,甚至可以说,越强的东西,越需要我们对它的边界保持敏感。

纳德拉昨天提了一个词,「反向信息悖论」。企业用 AI 时付钱的同时,也在不断暴露自己的专有知识、提示词和反馈,这些「智力废气」被模型学习,最后信息不对称倒向卖方。这话说得很重,但确实戳中了当前 AI 应用的一个核心困境。

所以今天我们与其继续惊叹模型有多强,不如多问自己一句,我交给 AI 的数据,到底去了哪里?