ChatGPT 和 Gemini 双双迈过 10 亿月活门槛。这条新闻让我想起三年前,ChatGPT 还要靠排队注册才能用上,Gemini 还叫 Bard 并且会一本正经地胡说八道。现在它们成了谷歌历史上增长最快的产品,甚至比搜索、YouTube 当年冲得更猛。用户规模到了这个量级,模型竞争早就不只是「谁更聪明」,而是「谁能把自己塞进更多人的日常流程」。

🔥 重点新闻

1. ChatGPT 与 Gemini 双双突破 10 亿用户

OpenAI 在 8 月 6 日的博客里宣布 ChatGPT 月活超过 10 亿。同一天,Google CEO 桑达尔·皮查伊也说 Gemini 月活达到 10 亿,这是谷歌史上增长最快的产品。

坦率地讲,10 亿这个数字本身的冲击力已经不如从前了。真正让我留意的,是两家几乎是约好了一样同时宣布。这说明聊天机器人已经从尝鲜工具变成基础设施,接下来要拼的是留存、分发和生态锁。ChatGPT 有桌面端、Codex、Work 多条线,Gemini 有 Gmail、Docs、Android 的入口优势。用户量只是起点,谁能把 10 亿人粘住,才是下半场。

来源,The Verge

2. DeepSeek-V4-Pro 正式上线,Agent 能力大幅增强

DeepSeek-V4-Pro 正式版在 APP、网页和 API 同步开放。Agent 能力明显提升,HLE 不用工具跑到 42.7,用上工具冲到 60.0,Terminal 代码任务成绩也不错。

更值得关注的是,DeepSeek 在同一天还开源了 Harness v0.1 开发者预览版。这是一个基于 Cordis 元框架构建的智能体框架,核心理念是「一切皆插件」。模型、工具、技能、会话、沙箱、循环编排都被拆成可插拔组件。

两件事放一起看,DeepSeek 明显是在同时做两件事,一是把基座模型往「能干活」方向推,二是把干活的基础设施交给社区。如果 Harness 生态能跑起来,它可能会成为国内 Agent 开发的一个重要底座。

来源,DeepSeek API 更新日志 / DeepSeek 官方

3. Google DeepMind 发布 Gemini 3.7 Flash

距离 3.6 Flash 才三周,Google 又推出 Gemini 3.7 Flash,主打编程和智能体任务。输入价格是每百万 token 0.75 美元,输出 3.75 美元,只有 3.6 Flash 的一半。

这个定价策略很直接,用更便宜的价格抢开发者。现在编程和 Agent 场景是高频调用、高 token 消耗的地方,价格砍半意味着同样预算可以做两倍实验。对 Claude 和 GPT 来说,这又是一波压力测试。

来源,Google DeepMind Blog

4. Claude 接管应用日常维护,数周开出 388 个 PR

Boris Cherny 分享了一个很具体的实验,他让 Claude 通过 Slack 频道接管应用的日常维护,包括崩溃模糊测试、重复代码统一、死代码移除。几周下来,Claude 自动提交了 388 个 PR,其中 180 个经过 Claude Code Review 后成功合入。

这个数字让我挺震惊的。不是因为它多,而是因为它说明了 AI 维护 legacy 代码的真实可能性。大多数团队 70% 的时间不是写新功能,而是修旧债、清包袱。如果这类任务能自动化一半,程序员的工作形态会彻底变样。

来源,Boris Cherny / Twitter

5. OpenAI 发布 GPT-5.6 构建者指南

OpenAI 更新了 GPT-5.6 系列,强调用更低成本实现前沿级智能体性能。新能力包括推理持久化、原生多智能体编排和程序化工具调用。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跳到 38.3%。

我看这条新闻时,最在意的是「推理持久化」。Agent 跑长任务最怕中间断掉重来,能把推理状态保留下来,相当于给长程任务加了一层续命机制。这个细节对实际落地比分数提升更重要。

来源,OpenAI 官网

6. Cursor 推出 builds,云智能体启动速度提升 3 倍

Cursor 新功能 builds 在后台持续准备开发环境副本,云智能体启动时不需要从零搭环境。内部环境启动快 10 倍,首个 token 生成快 3 倍。

云智能体真正的瓶颈往往不是模型速度,而是环境准备。每次启动都重新装依赖、拉代码、配环境,几分钟就耗掉了。Cursor 这步是在做工程层面的优化,把模型体验往前推了一步。

来源,Cursor Blog

💡 值得关注

  • MiniMax Music 3.0,新一代开源音乐生成模型,支持按创意概念和歌词一次性完成整首歌,最长 5 分钟。来源,MiniMax Blog
  • Qwen3.8-2.4T-A95B 开源,2.4T 总参数、95B 激活参数,主攻自主编码和端到端智能体执行。硅基流动已经上线 Day-0 API 支持。来源,SiliconFlow
  • Google Sheets canvas,用自然语言把表格变成交互式迷你应用,比如仪表盘、学习追踪器。Gemini 正在往办公套件里渗透。来源,Google Blog
  • OpenRouter 实时网页搜索基准,评测模型、搜索引擎、搜索方法和预算的组合。数据显示搜索预算从 1 轮提到 25 轮,BrowseComp 得分接近翻倍,成本只增加 2.5 到 7 倍。来源,OpenRouter
  • Research Gold 丑闻,一个号称「100% 人类撰写、绝不使用 AI」的医学写作服务,被曝审稿人头像和身份都是 AI 生成,部分真实方法学家照片被冒用。来源,Hacker News

📝 今日思考

今天最强烈的感受是,AI 行业正在从「发布更好的模型」转向「把模型塞进更具体的工作流」。DeepSeek 开源 Agent 框架、OpenAI 强调推理持久化、Cursor 优化环境启动、Claude 做代码维护,这些都不是炫技,都是在解决一个共同问题,模型很强,但用起来还是太碎。

10 亿用户是里程碑,但下一个里程碑更关键,让这 10 亿人里的每一个,都能把 AI 真正变成自己的工作伙伴。