今天早上刷 RSS 的时候,我数了一下,AI HOT 过去 24 小时涌进来 99 条新闻。

Cursor 被 SpaceX 收了,Qwen 3.8 27B 开源且强得离谱,DeepSeek V4 Pro 和 Grok 4.6 同一天发布。这三件事搁在一起看,已经不是「谁家模型更强」的打法,而是 AI 正在从「拼参数」快速滑向「拼落地」。

我挑了 10 条值得细聊的新闻。

🔥 重点新闻

1. Cursor 正式被 SpaceX 收购

这个消息来得不算突然。

4 月份就传出收购传闻,现在尘埃落定。Cursor 并入 SpaceX 后,能得到全球最大规模的 GPU 集群,官方说法是模型会更强、运行成本更低,最终用户拿到的价格也会更低。

我关注的是另一个细节,本周三发布的 Grok 4.6 已经是双方合作产物。也就是说,SpaceX 不只是给钱,而是把算力和工程团队直接喂给了 Cursor 的模型迭代。

对开发者来说,变化可能在哪里?

坦率地讲,现在 AI 编程工具的竞争早就不是「谁补全代码更准」,而是「谁能用更低的成本提供更完整的模型栈」。Cursor 绑上 SpaceX 这条大船,背后真正的筹码是垂直整合。如果它能把训练和推理的成本压到比对手低一个数量级,其他编辑器+API 的组合会很难受。

来源,AI HOT(Cursor Blog)

2. 阿里开源 Qwen 3.8 系列

Qwen 3.8 是一次集群式发布。

Qwen 3.8-27B 是 Apache 2 许可的视觉大模型,原生多模态、稠密架构,官方基准说它已经全面超过 Qwen 3.7-Plus。上下文拉到 262K,还能通过 YaRN 扩展到 1M tokens。

同一天,Qwen 3.8-2.4T-A95B 也放出来了,2.4T 参数、95B 激活,主打自主编码、深度研究和端到端智能体执行。硅基流动已经上线 Day-0 API,输入 $2、输出 $6 每百万 token。

这个定价放在当前市场里,就是贴着 Claude 和 OpenAI 的下沿打。

Simon Willison 实测后给了一个提醒,模型能力很强,但默认推理强度偏高,容易过度思考。我用 Qwen 3.7 的时候也遇到过,让它写个简单函数,它能给我扯出三层抽象。我的做法是手动把 thinking budget 调低,或者直接用非推理版本。

开源模型越来越强,但「默认配置太聪明」反而成了新的坑。

来源,AI HOT(Simon Willison 博客)AI HOT(Alibaba Qwen)AI HOT(SiliconFlow)

3. DeepSeek V4 Pro 上线,DeepSeek Harness 开源

DeepSeek 今天也是双线出牌。

V4 Pro 正式版在 App、网页和 API 同步上线,Agent 能力提升明显,HLE(带工具)冲到 60.0,Terminal Bench 成绩也接近 Claude Fable 5。模型名直接改成 deepseek-v4-pro,输入输出价格比前代 Pro 便宜。

更让我意外的是 DeepSeek Harness v0.1,MIT 开源,基于 Cordis 元框架,核心理念是「一切皆插件」。模型、工具、技能、会话、沙箱、文件系统、循环、编排,全部能插拔。

这不像一个框架,更像一套乐高。

DeepSeek 的路线越来越清晰,模型+框架+价格一起打。如果 Harness 的生态能起来,它就有机会成为国内 Agent 工作流的事实标准。但生态能不能起来,关键看文档、示例和开发者口口相传。

来源,AI HOT(DeepSeek API 更新日志)AI HOT(deepseek_ai)

4. Gemini 3.7 Flash 全面开放,价格砍半

Google 离 3.6 Flash 发布才三周,3.7 Flash 就来了。

这次主打编程和智能体任务,输入 $0.75、输出 $3.75 每百万 token,是 3.6 Flash 的一半。Pro 和 Ultra 用户已经能在 Gemini 聊天里用到,Gemini Spark 也切到了 3.7 上。

Google 的打法很明显,用高频小版本和低价把开发者圈进自己的生态。

我真正想试的是它在长上下文多文件任务上的表现。它标榜能把几十个文件和邮件合并成一份主文档,如果实际可用,这会直接吃掉很多现有的 RAG+长文档流程。

来源,AI HOT(Google DeepMind Blog)AI HOT(GeminiApp)

5. 智谱 GLM-5.3 发布,网络安全能力涌现

GLM-5.3 基于和 5.2 相同的基座,但通过极致的后训练 Scaling 把智能上界往上顶。

公开成绩是,编程能力较前代提升 50%,Terminal Bench 3.0 等基准拿到开源第一,接近 Claude Fable 5。

更让我注意的是,它「涌现出网络安全能力」。

这个表述有点大胆。后训练 Scaling 确实能擦出新的能力,但「网络安全」这种敏感能力,一旦对外开放,安全和监管都会被放到放大镜下。智谱这次选择放出来,说明他们在模型可控性上有一定底气。

来源,AI HOT(智谱 GLM)

6. Anthropic 发文,多智能体系统的模式与问题

Anthropic 这篇研究不是发模型,而是发了一个观察。

智能体一旦进入共享代码库、市场这类社会系统,它们之间的真实交互会远远超过人机交互。实验里,45 个协调式智能体在 2700 万 token 运行中发现了 266 个漏洞,而独立并行方法只发现 21 个。

这个差距大到让人有点头皮发麻。

但它也提示了另一件事,多智能体协作不是简单的「人多力量大」,而是需要协调机制。如果未来代码库、交易系统、甚至基础设施里都有大量智能体在互相操作,安全和审计将成为最复杂的工程问题。

来源,AI HOT(Anthropic Research)

7. Claude 接管应用维护,数周开出 388 个 PR

Boris Cherny 做了一个实验,让 Claude 通过 Slack 频道接管自己应用的日常维护。

任务包括崩溃模糊测试、重复代码统一、死代码移除。几周之内,Claude 自动开了 388 个 PR,其中 180 个通过 Claude Code Review 后直接合并。

这个数字听起来很炫。

但我想泼点冷水,它没说这 388 个 PR 里有多少是低价值的格式修改,也没说工程师事后花了多少小时去验证和兜底。自动 PR 和真正「无人值守」的维护之间,还差一个生产级信任链。

来源,AI HOT(bcherny)

8. 微软首发自研推理模型 MAI-Thinking-1

微软终于拿出自己的推理模型了。

Mustafa Suleyman 在 X 上宣布 MAI-Thinking-1 从零开始构建,已在 Microsoft Foundry 上线。这是微软第一次明确把自己的推理模型推到台前。

以前微软更多是靠 OpenAI 的模型撑门面,现在它也要双线布局。这会让 Azure 和 Foundry 的卖点从「接入 GPT」变成「接入 GPT + 自研模型」。

对开发者来说,多一个选项总是好事。但新模型刚出来,真实能力还要等社区跑一轮基准。

来源,AI HOT(mustafasuleyman)

💡 值得关注

  • Google Sheets Canvas,用 Gemini 把表格数据变成交互式迷你应用。自然语言驱动仪表盘、学习追踪器、座位表。如果效果稳定,它会把「表格+脚本」的场景再往下压一层。来源,AI HOT(Google Blog)
  • AI 生成书籍正在淹没亚马逊,一项对 14,419 本自出版电子书的分析显示,书目总量三年增长 38.3 倍,但季度收入只增长 8.9 倍。人类作者的单书收入在被稀释。来源,AI HOT(The Decoder)
  • Hugging Face 夏季开源生态报告,2026 年 1-8 月公开模型仓库从 243 万涨到 296 万,但 85.6% 的模型下载量不足 200 次。头部 1.5% 的仓库吃掉 99.2% 的下载。开源不是没机会,但分发窗口正在急速收窄。来源,AI HOT(Hugging Face Blog)
  • 小红书 dots3-note Preview 开源,280B 总参数、16B 激活,512K 上下文,多模态理解,面向复杂推理和长程 Agent。来源,AI HOT(小红书技术)

📝 今日思考

今天这一批新闻,我最大的感受是「疲劳感」。

不是说新闻不重要,而是模型发布的密度已经高到让人麻木。Qwen、DeepSeek、Gemini、GLM、Grok、MAI-Thinking-1,各家都在用更短的周期、更大的参数、更低的价格抢注意力。

但真正让我停下来的是两件事,

第一,Cursor 被收购,标志着 AI 编程工具开始绑定算力帝国,竞争维度变了。

第二,Anthropic 那篇多智能体研究,把问题从「模型强不强」拽到了「智能体之间怎么协作、怎么出错、怎么追责」。

接下来一年,谁能把 Agent 真正放进生产流程,谁才有机会从这场参数游戏里脱身。