你有没有那么一刻,打开AI新闻时感觉信息量要爆炸了?今天就是这样。一边是ChatGPT和Gemini同时跨过10亿月活门槛,另一边是一份研究警告,2032年前人类级AI可能通过自我改进催生失控超级智能。一边在庆祝规模,一边在担心失控。反差越大,越说明我们正站在一个岔路口。

🔥 重点新闻

1. ChatGPT 与 Gemini 双双突破 10 亿用户

OpenAI 在 8 月 6 日的博客里宣布,ChatGPT 的月活用户已经超过 10 亿。几乎是同一时间段,Google 的 CEO 桑达尔·皮查伊也宣布,Gemini 的月活达到 10 亿,成为 Google 史上增长最快的产品。

这是件很值得细品的事。两家顶级实验室,把聊天机器人从「尝鲜玩具」硬生生推到「10亿级日常工具」的位置。它说明,至少对于普通用户来说,对话式AI已经不是新鲜玩意儿,而是正在成为手机、搜索、邮件、办公套件旁边的基础设施。

但我更在意的是,这么大的用户基数,盈利模式真的撑得住吗?OpenAI 和 Google 都还在烧大钱训练模型,免费用户占大头。所以这个数字背后,其实是一份更大的账单,以及更迫切的商业化压力。

来源,The Verge

2. 研究人员发现可读取推理模型加密思考过程的API漏洞

Alexander Panfilov 团队最近披露了一项让人后背发凉的发现。他们对 OpenAI、Anthropic、Google 等主要AI厂商的 API 做了安全扫描,大约 7000 条公开会话里,找出了 62 个 API 密钥、33 个邮箱和 33 个密码。更关键的是,他们通过越狱手段,能够读取那些号称「加密」的推理模型的思考过程。

这件事的可怕之处,不只是密钥泄露本身。它提醒我们,o1 这类推理模型被寄予厚望的原因之一,就是它的内部思维链被设计为「不可见」,从而避免被用户诱导或商业竞争对手逆向。但如果这个隔离层可以被击穿,模型在推理中暴露的中间步骤、思考路径、甚至潜在偏见,都会被别有用心的人利用。

对厂商来说,这是个严肃的工程问题。对普通用户来说,一个更朴素的提醒是,别把 API 密钥到处乱贴,也别把敏感数据喂给不信任的接口。

来源,The Decoder

3. Ryan Greenblatt 警告,人类级AI或于2032年前催生失控超级智能

Dwarkesh Patel 在最新一期播客里请来了 Redwood Research 首席科学家 Ryan Greenblatt,两个人聊了一个很硬核的话题,递归自我改进(RSI)。Greenblatt 的中位预测是,一旦 AI 达到人类顶级专家的水平,可能在一年之内实现相当于四到五年的人类AI研究进展。再往前推一步,2032 年前出现失控超级智能,并不是完全不可想象。

我第一次听这个数字时,脑子里冒出的不是恐惧,而是怀疑。这种预测太依赖一连串「如果」,如果模型能自己改自己的代码,如果算力继续指数级增长,如果安全问题能被解决,或者相反,如果没人真正解决。但反过来想,过去一年里,agent 从概念到实际工具的速度,确实让很多人原来的时间表都显得保守了。

所以我的态度是,不必把它当末日预言,但值得把它当作一个时间表上的提醒,对齐、安全、可控性这些听起来很虚的词,正在成为真正硬实力的竞争点。

来源,Dwarkesh Patel Podcast

4. OpenAI Astra 模型攻克 10 道数学难题,数学家既兴奋又担忧

OpenAI 这次放出了一个叫 Astra 的未发布模型,声称用它解决了 10 道长期悬而未决的数学难题,覆盖了球体堆积、纠错码、非 sofic 群存在性等领域。他们还发了一篇超过 250 页的论文,并给出了 Lean 形式化验证的结果。

数学圈里的人反应很分裂。兴奋的一边觉得,这可能是AI第一次真正触及人类数学家几十年没攻下来的硬问题。担忧的一边则在问,这些结果到底能不能被独立复现?模型在探索过程中产生的中间推导,人类能不能完全理解?OpenAI 没有公开模型本身,只给了结果,这在科学共同体里天然就会引起争议。

我个人觉得,这件事最大的意义不是「AI搞数学比人强了」,而是它把「可验证性」推到了风口浪尖。如果AI能证明一个定理,但没有人能解释它是怎么想的,那人类对数学的信任基础会不会被动摇?

来源,The Verge

💡 值得关注

  • Meta 发布开源模型 Muse Glimmer,30B 参数,专门为本地常驻运行的智能体工作流优化,主打消费级硬件可部署。开源模型能不能在 agent 场景里打出差异化,这是接下来的一个看点。 来源,@AIatMeta

  • NVIDIA 推出 Nemotron 3.5 Lightning,30B 总参数、3B 激活参数的 MoE 模型,支持最长 1M token 上下文,面向本地常驻 agent。SGLang 已经 day-0 支持。它想抢的不是大模型推理,而是「常驻在你电脑里的 agent」这个位置。 来源,NVIDIA Blog

  • Apple Silicon 虚拟机里的 Llama.cpp 提速 11 到 16 倍,研究团队为 macOS 虚拟机里的 Metal 查询加了进程级兼容层,让 TinyLlama 1.1B 的提示处理速度提升超过 11 倍。对在 macOS 虚拟机里跑本地模型的同学,这是个很实在的工程进展。 来源,Hacker News

  • a16z 的数据显示,计算机操作 agent 在 OSWorld-Verified 基准上已经达到 85%,超过人类测试者约 72% 的水平。一年前这个数字还是 42%。 agent 用电脑的进展曲线,比很多人预想的更陡峭。 来源,a16z News

  • AI 会议平台 tl;dv 泄露 18.1 万段录音,因为 Firestore 数据库缺乏租户隔离,任何已认证用户都能查询全部会议记录。这件事再一次说明,AI 原生工具在数据隔离上犯的错,往往是最基础的那一种。 来源,Hacker News

  • 微信内测小微 AI 帮写和 AI 点评朋友圈,可以按图片和文字生成朋友圈文案,也能长按文字自动生成评论。技术的便利性是有的,但「朋友圈最后一点人味」这个说法,确实戳中了不少人的不适感。 来源,数字生命卡兹克

  • Runway Seedance 2.5 上线,支持 50 个角色参考,最长 30 秒、与音乐同步的片段。视频生成赛道现在越来越像音乐 MV 和短片的工业化工具了。 来源,Runway

📝 今日思考

今天的新闻拼在一起,像是一幅矛盾的图。

一边是产品侧的快速成熟,10 亿用户、本地 agent 模型、agent 能操作电脑、视频生成工具越来越像剪辑软件。这些信号都在告诉我们,AI 正在从 demo 变成流水线。

另一边是系统性的不安,API 漏洞把推理模型的「黑箱」击穿,递归自我改进的警告时间线被推到 2032 年,数学成果的可解释性受到质疑。这些问题不是技术细节,而是信任问题。

所以我的感受是,接下来一年,AI 领域最值得关注的不是某个新模型 scores 多少,而是「谁能把规模和安全同时做稳」。做好了,就是下一代基础设施;做不好,10 亿用户带来的反噬,也会比过去任何一次科技危机更快。

这就是今天的 AI 日报。我很好奇,你更看好哪一边?