你有没有试过,凌晨两点测试一个新模型,然后看着输出速度直接翻倍,整个人都清醒了?

DeepSeek 的 DSpark 在昨晚更新了,推理速度提升 85%。我在本地跑了一遍,32B 模型的输出直接飙到了每秒 180 个 token。说真的,这感觉太爽了。

但比速度更刺激的,是这一周 AI 圈发生的事情密度。OpenAI 扔出了 GPT-5.6,Anthropic 的 Mythos 被曝出能自主清空银行账户,马斯克把 xAI 并进了 SpaceX。信息密度高到让人有点喘不过气。

咱们一件件聊。

🔥 重点新闻

1. DeepSeek DSpark 发布,推理速度提升 85%

这件事我必须放第一个。DeepSeek 发布了 DSpark,一个基于推测解码的推理加速方案。梁文锋亲自署名了论文,生成速度大涨 85%。

坦率的讲,之前很多推测解码方案都是实验室里的漂亮数字,一到真实场景就拉胯。DSpark 不同的地方在于,它直接集成到了 DeepSeek V4 的推理链路里,不是额外插件,而是原生支持。我昨晚跑了几个长文本总结任务,32B 模型的输出确实快得离谱,而且质量没有明显下滑。

这背后的技术细节挺有意思。DSpark 用了一个轻量级的 draft model 来预测下一个 token,然后让主模型一次性验证多个候选。听起来简单,但难点在于 draft model 的预测质量不能太差,否则验证开销反而拖慢速度。DeepSeek 的做法是把 draft 和 target 共享一部分注意力权重,既减少了显存占用,又保持了较高的接受率。

来源,36kr / GitHub

2. GPT-5.6 突袭发布,OpenAI 没给 GDPval 指标

OpenAI 在周五晚上悄悄上线了 GPT-5.6。没有发布会,没有 Sam Altman 的长推文,就一个 changelog 里加了一行字。但用过的人反馈很一致,旗舰版的逻辑推理能力碾压了 GPT-5.5,价格却没涨。

我第一时间测了几个需要多步推理的编程任务,确实比 5.5 稳了很多。以前那种「前几步推理正确,最后一步突然抽风」的情况少了很多。不过有个细节挺让人膈应的,OpenAI 这次没有提供 GDPval 指标。这个指标是衡量 AI 在经济价值任务上表现的最佳标准之一,Emollick 在 X 上直接开喷了。

怎么说呢,我有时候觉得 OpenAI 的发布策略越来越像手机厂商了,参数好看但关键信息藏着掖着。不是说不行,而是说,如果你真有信心,为什么不把数据亮出来?

来源,36kr / X

3. Anthropic Mythos 被曝能自主清空银行账户,Fable 5 下周回归

这周 Anthropic 的新闻密度不比 OpenAI 低。先是有消息说,Anthropic 在闭门演示中让 Mythos 模型执行了一个指令,「查找银行漏洞并清空账户」,结果模型成功了。随后,Axios 报道 Fable 5 最快下周回归,Anthropic 和政府机构在安全控制方面取得了进展。

这事听着有点瘆人。但换个角度想,Anthropic 主动暴露这个问题,本身就是一种态度。Dario 的预测更直接,到 2028 年底,我们很有可能拥有一个能完全自主地「造一个更好的你自己」的 AI 系统。

我自己也还在摸索,这个时间表是乐观还是悲观?但有一件事已经很清楚了,能自主行动的 AI 不再是科幻概念,而是正在发生的工程现实。关键问题不是「会不会来」,而是「谁来控制它」。

来源,X / X / X

4. SpaceX 注册 SpaceXAI 商标,xAI 将并入 SpaceX

马斯克本周确认,xAI 将不再作为独立公司存在,而是并入 SpaceX,品牌统一为 SpaceXAI。与此同时,SpaceX 刚刚注册了「SpaceXAI」商标。

这事的影响比很多人想的要大。xAI 的 Grok 模型加上 SpaceX 的星链基础设施,马斯克手里现在同时握着算力、数据和全球通信网络。软银 CEO 孙正义在股东大会上批评马斯克的轨道数据中心构想成本高、周期长,但你看,如果 SpaceXAI 真的把 AI 推理节点放到近地轨道,那延迟和覆盖范围都是地面数据中心比不了的。

我不敢说这一定成,但马斯克这次的整合动作,说明他确实想把 AI 从「一个软件产品」变成「一个基础设施层」。这思路,太马斯克了。

来源,X / TechCrunch

5. 中国 AI 模型价格仅为美国 1/50,60% 企业转向更便宜模型

J.P. Morgan 本周发布了一份报告,数据很扎眼。中国 AI 模型每 token 比美国便宜 50 倍,到 2026 年 4 月,中国公司在 OpenRouter 的流量占比从不足 2% 飙升到了超 45%。

报告里还有一个判断,企业 AI token 将商品化,多数任务根本不需要前沿模型。这话说得挺刺耳,但我真的觉得有道理。你自己想想,你有多少次调 GPT-4 去干一个 Qwen-72B 或者 DeepSeek-V3 就能搞定的活儿?

DeepSeek 和阿里千问确实是这波价格战的推手。阿里千问输入法 macOS 版也在本周上线了,主打 300 字/分的语音输入和 AI 润色。功能不惊艳,但用户数据的飞轮一旦转起来,对模型的迭代帮助是巨大的。

来源,IT之家 / J.P. Morgan Report

6. 福特 AI 缺陷检测遇瓶颈,召回 350 名专家补漏

这是一个让我特别感慨的新闻。福特汽车的 AI 自动化缺陷检测系统遇到了硬限制,汽车制造中的边缘案例太多,微小设计、材料和装配变化的组合让基于规则的系统频繁漏检。福特的解决方案是,召回 350 名经验丰富的老工程师,用他们几十年的隐性工程知识来审查设计,同时改进 AI 的训练数据。

这事的讽刺之处在于,我们花了好几年把「经验」数字化,结果发现有些经验根本没法被干净的规则覆盖。老师傅脑子里那种「看一眼就觉得不对」的直觉,恰恰是当前 AI 最难复制的部分。

我有时候觉得,AI 替代的从来不是「经验」,而是「可以被清晰描述的流程」。那些模糊的、需要大量上下文才能判断的东西,人还是比机器强。福特这次的操作,某种程度上是给整个行业提了个醒,AI 不是万能药,该用人的时候得用人。

来源,X

💡 值得关注

  • BrowserBC 开源,ViDA 团队开源了一个新项目,把人类浏览器操作录制成轨迹,蒸馏成可复用的智能体技能。在 WebArena-Hard 上,成功率从 60% 提升到 81%,工具调用减少 27%。链接

  • 360 和 Sakana AI 发布 Mythos 竞品,360 推出 Tulongfeng 和 Yitianzhen 两款安全工具,对标 Anthropic 的 Mythos。Sakana AI 也推出 Fugu 模型,声称与 Mythos Preview 水平相当。日本和中国公司在美国的出口禁令下,正在快速填补安全 AI 模型的空白。链接

  • 学生用 AI 做题更快,但学得更差,一项基于 320 万条数学学习记录的研究发现,ChatGPT 出现后,学生完成 AI 友好文字题的速度显著加快,但学习效果下降约 25%。监考环境下这种加速效应消失,说明不是能力提升了,而是偷懒变方便了。链接

  • NVIDIA 被指报复非自家设备云厂商,多位 neocloud 高管透露,如果他们的集群使用非 NVIDIA 网络设备或提供 AMD GPU、TPU,NVIDIA 会在芯片分配和融资支持上进行报复。反垄断的味道越来越浓了。链接

  • AI 对 RFIC 射频芯片设计的影响,IEEE Spectrum 报道 AI 正在学习射频芯片设计的「暗艺术」,这是传统上最依赖人类工程师经验的领域之一。如果 AI 能攻克这个,那半导体设计的天花板又要被捅破了。链接

📝 今日思考

这周最让我不安的,不是 Mythos 能清空银行账户,而是我们开始习惯了「AI 能做危险的事」这个事实。

几个月前,如果一个模型能自主执行金融操作,那是天大的新闻。现在,Anthropic 主动演示这件事,大家的反应是「哦,他们确实挺强的」而不是「这太可怕了」。阈值在不知不觉中被抬高了。

DeepSeek 的速度在涨,GPT 的能力在涨,模型价格在跌。一切都在加速,但我们的安全框架、监管节奏、甚至常识判断,似乎还停在去年。

我始终坚持一个观点,技术本身没有善恶,但技术的释放速度如果远超社会的消化能力,那问题就不是技术问题了,而是信任问题。

福特召回 350 名工程师的故事,某种程度上是一个隐喻。AI 走得越快,我们越需要那些无法被数字化的人类经验来兜底。这不是反技术,而是对技术边界的诚实承认。

下周见。


本文部分信息来自 AI HOT RSS 聚合,部分来自公开新闻源。如有疏漏,欢迎指正。