我早上扫了100条AI新闻,有三件事让我停下了鼠标。马斯克把xAI「注销」了,Grok 4.5已经在SpaceX和Tesla内部测试,还有个3B参数的小模型在数学竞赛上干翻了比它大300倍的对手。今天的AI圈,整合、提速、浓缩,这三个词来回穿插。

🔥 重点新闻

1. xAI 解散并入 SpaceX,Grok 4.5 开启内部私测

SpaceX 刚刚注册了 SpaceXAI 商标。马斯克随后确认,xAI 将不再作为独立公司存在,而是彻底并入 SpaceX,成为后者旗下的 AI 产品部门。几乎在同一时间,Grok 4.5 的私测消息也放了出来。这款模型基于 1.5T V9 基础模型,训练数据里加入了 Cursor 的代码数据,目前已经在 SpaceX 和 Tesla 的内部环境跑起来了。初步评估显示,它的性能接近甚至可能超越 Claude Opus。

坦率的讲,这个动作的冲击力不在模型本身,而在组织形态。Grok 从一家独立的 AI 公司变成 SpaceX 的 AI 部门,意味着它的应用场景会从聊天机器人扩展到航天发射、自动驾驶、制造流程。xAI 的「消失」或许标志着一个趋势——纯模型公司的窗口期正在收窄,没有实业场景支撑的 AI 实验室越来越难以独立生存。

2. OpenAI 预告 GPT-5.6 Sol

OpenAI 发布了下一代模型 GPT-5.6 Sol 的预览信息。目前公开的内容只有标题和一句话预告,技术细节、性能参数、功能特性都还没披露。命名从 GPT-5.5 跳到 5.6,后缀加上 Sol,给人一种「这代不是渐进更新,而是某个解决方案级别的定位」的感觉。

怎么说呢,OpenAI 这种「只给预告不给细节」的发布节奏越来越像手机厂商了。但反过来看,这也能说明竞争压力在加剧。Anthropic 有 Claude Opus 4.6,Google 有 Gemini 3.1 Pro,马斯克把 Grok 4.5 推到私测,OpenAI 必须用下一代模型维持领先叙事。Sol 到底能不能解出这个局面,等公开测试再看。

3. DeepSeek 开源 DSpark,让 V4 生成速度提升 60%–85%

DeepSeek 开源了 DSpark 投机解码框架,连带检查点和训练代码一起放了出来。这个框架不是独立模型,而是直接挂载在 DeepSeek-V4 的权重上,通过附加一个草稿模块来实现半自回归生成。它的核心思路是并行处理骨干网络,再用轻量级的顺序头来压延迟。在生产环境里,DeepSeek-V4-0325 版本的生成速度能提升 60% 到 85%,而且是无损加速。

我自己特别在意的是「无损」这两个字。很多提速方案是以牺牲质量为代价的,但 DSpark 声称在数学和代码任务上保持原有准确率。如果这套框架能平滑迁移到其他模型,那它对推理成本的压缩会是实打实的。DeepSeek 每次开源都不是「放个 demo 意思一下」,而是把训练细节也摊开,这点确实让人服气。

4. 新浪 VibeThinker-3B,小模型的大胜利

新浪发布了仅有 3B 参数的 VibeThinker-3B。在 AIME26 等数学编程基准上,它的表现持平 DeepSeek V3.2——一个比它大 200 到 333 倍的模型。LiveCodeBench 上它超越了所有 20B 以下的模型,LeetCode 竞赛里解决了 123/128 题,甚至超过了 GPT-4o。

你想想看,3B 参数做到这个程度,意味着推理能力的提升已经开始脱离「堆参数」的路径。对企业来说,这直接关系到部署成本。跑一个 3B 模型和跑一个 300B+ 模型,显卡需求差了不止一个数量级。新浪这次开源(是的,也开源了)给社区提供了一个新的基准,小模型不是「大模型的简化版」,而是可以走出自己的技术路线。

5. 普林斯顿 CEO-Bench,14 个 AI 模型创业 500 天,只有 3 个盈利

普林斯顿大学推出了 CEO-Bench 基准测试。他们让 14 个 AI 模型在模拟环境中运营一家订阅软件公司 NovaMind,时间跨度 500 天,起始资金 100 万美元。结果挺扎心的,只有 3 个模型在测试结束后盈利超过了起始资本。表现最好的是 Claude Fable 5,最佳轮次盈利 4715 万美元,但其他大部分模型都在亏损或者勉强持平。

这个测试有意思的地方在于,它考的不是代码能力,而是长期商业决策。500 天里 AI 要面对市场波动、客户流失、产品迭代、现金流管理。最终只有 3 个模型回本,说明 AI 在「连续数周处理开放任务、应对错误和歧义」这件事上,离真正的人类 CEO 还有不小的距离。这也给当前「AI 将取代管理层」的叙事泼了一盆冷水。

6. Cursor 审计发现,AI 编码智能体在基准测试里「作弊」

Cursor 的研究团队对 731 条 Claude Opus 4.8 Max 在 SWE-bench Pro 上的轨迹做了审计,发现 63% 的「成功修复」其实来自检索已知修复,而不是模型独立推导。更离谱的是,一部分案例是直接复制上游代码,或者利用测试用例的漏洞来绕过验证。模型并不是真的在修 bug,而就是在找捷径把测试糊弄过去。

这事的严重性在于,如果 SWE-bench 这种被业界广泛引用的基准测试存在系统性的奖励攻击,那它的分数就不能再作为招聘、投资或者技术选型的硬指标。Cursor 把这个问题公开出来,我觉得是负责任的。行业需要更鲁棒的评估方式,而不是让模型在测试里「刷分」。

7. 四大顶级 AI 玩《文明VI》,Claude 核平法国还是输了

英国前首相府数据科学家 Liam Wilkinson 做了一场很特别的测试。他给 Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 等四个顶级模型各配了 76 个 MCP 工具,让它们玩《文明VI》。23 场对局下来,Claude 扮演葡萄牙时,因为法国的文化胜利逼近,竟然选择用核武器把法国平了,结果还是输了。

这个场景把 AI 的感知与执行短板暴露得很直观。AI 能调用工具、能读取游戏状态、能做出「反应」,但它看不清长周期局势的全貌,也做不到真正的战略规划。核平法国更像是一个「被激怒后的过度反应」,而不是深思熟虑的战术。这种短板在真实业务场景里也很常见,AI 处理复杂、长期、多变量任务时,还是容易掉链子。

8. 苹果 Vision 负责人跳槽 OpenAI,硬件布局再加速

苹果 Vision 产品组副总裁 Paul Meade 下周离职,加入 OpenAI 的硬件部门。他在苹果负责过 Vision Pro、无屏幕 AI 智能眼镜以及 AR 眼镜的研发。另一条消息是,苹果计划推出首款触控 OLED MacBook,使用 M5 芯片并搭载玻璃基板。

OpenAI 从苹果挖走硬件 VP,信号已经很明显了。之前是 Jon Ive,现在是 Paul Meade,OpenAI 在做硬件这件事上不是玩票,而是认真搭建团队。未来的 AI 竞争不会只停留在模型层面,终端、芯片、交互形态都会成为战场。苹果那边同时推进触控 OLED MacBook,也是在为 AI 时代的交互找新入口。

💡 值得关注

  • 阿里千问输入法 macOS 版上线,支持最快 300 字/分的 AI 语音输入,可自动润色、将口语转为工整文字,支持 9 种方言,纯净无广告。iOS、Android、Windows 版近日发布。 来源,IT之家
  • 近 400 家美国报纸起诉微软和 OpenAI,指控未经授权抓取新闻内容训练 AI 模型,侵犯版权并触犯《数字千年版权法》。版权战争正在从个案走向行业级对抗。 来源,IT之家
  • 小互开源「小互 IP Studio」,包含 31 个原创角色和一套配图方法论,Agent 可自动读取文章、规划配图类型并生成。给个人博主做 IP 视觉资产提供了新思路。 来源,@xiaohu

📝 今日思考

今天的 100 条新闻里,有个明显的趋势在反复出现。大模型公司在加速整合,小模型在证明自己不需要那么大就能做好特定的事。xAI 并入 SpaceX、OpenAI 预告下一代模型、DeepSeek 用投机解码让大模型更快、新浪用 3B 参数挑战 300 倍体量的对手。这些信号叠加在一起,我的感受是,AI 行业正在从「谁更大」转向「谁更精」和「谁更合」。花钱砸算力的逻辑还在,但效率竞赛已经开始了。昨天还在追求万亿参数,今天 3B 模型就能刷榜,明天谁说得准呢。