一边是 AWS 追加 200 万颗 GPU 的长期订单,一边是浏览器里的 Claude 开始替人点按钮。今天的 AI 新闻摆在一起看,会有一种很具体的割裂感,底层基础设施还在用十亿美元和多年交期说话,产品层已经在讨论把多少控制权交给 Agent。

这两件事其实连着。

算力继续向头部云厂商集中,Agent 则开始进入真实工作流。模型能力的竞赛没有停,只是战场正从聊天框挪到浏览器、终端、企业数据和每一条可执行的操作上。

今天最值得盯住的四件事

英伟达和 AWS 把供给问题摆到了台面上

英伟达预计 2028 财年销售额同比增长约 70%,黄仁勋的说法更直接,实际需求高于这个数字,限制增长的是供应能力。与此同时,英伟达将在 2027 至 2028 年为 AWS 额外供应 200 万块 GPU,亚马逊此前五个月已经同意部署超过 100 万块英伟达 GPU。

这不是一份普通的大单。云厂商愿意跨两个财年锁定如此规模的设备,买的不是今天的 token,而是未来几年承接模型训练、推理和企业 Agent 工作负载的排队资格。

英伟达刚公布的财报也给这件事加了注脚,2027 财年上半年营收为 1778.37 亿美元,归母净利润 1180.1 亿美元,第二财季营收同比增长 106%。数字很吓人,但更值得警惕的是供给集中。开发者看到的可能是模型 API 降价,云厂商真正争夺的却是机柜、电力、网络和交付节奏。

GPU 不是背景板,它正在决定谁有资格把 Agent 做成基础设施。

来源,英伟达营收与需求预期AWS 扩大 GPU 订单英伟达半年报

Claude in Chrome 全面开放,重点不是省掉几次点击

Anthropic 宣布 Claude in Chrome 向全部付费套餐开放。它可以在浏览器中执行操作,系统会在每次动作前通过安全分类器判断操作是否安全、是否符合用户请求。

从产品角度看,这一步比浏览器侧边栏聊天更激进。聊天模型给建议,浏览器 Agent 直接改页面、填表、检索、跳转,它接触的是用户真实账号里的权限和状态。体验会非常顺滑,边界也会非常麻烦。

很多人对这类产品的顾虑并不保守。银行后台、采购系统、工单平台里,一个看似合理的按钮都有可能触发不可逆动作。把逐步审批全部拿掉,前提不是模型更会点鼠标,而是用户能看清它将要做什么,也能在出错时快速收回权限。安全分类器是必要的一层,但不会是最后一层。

真正的考题是,用户愿意把哪一段工作交出去。

来源,Claude in Chrome

Qwen 和 GLM 继续把开源模型往可用成本上压

通义千问发布 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览开放权重。模型总参数 125B,每个 token 激活 6B,训练成本约为 Qwen3.7-Plus 的九分之一。智谱则开源 GLM-5.3-Flash,320B 总参数、18B 激活参数,主打原生多模态和更低价格。

这类发布里最容易被忽略的一行,是每 token 激活的参数规模。大模型的总参数继续变大,不等于每次调用都要支付同样大的算力账单。MoE 的价值正在从论文里的架构选择,变成产品团队能不能把能力、时延和成本一起算明白。

不过,公开 benchmark 和价格宣传都只能当作候选清单,不能替代你的任务测试。做代码 Agent、知识库问答、长上下文抽取,坏案例往往不在平均分里。别因为模型便宜就直接换生产链路,也别因为模型大就默认它可靠。

来源,Qwen3.8-Flash-NextGLM-5.3-Flash

Agent 的改进循环,开始从 Prompt 技巧变成工程资产

Warp 分享了它在 Claude 上构建自我改进 Agent 的方法。团队把基础技能和改进技能拆成文件,用人类反馈持续修改 Agent 的行为,并把这套机制用在有数百名贡献者、数千次代码审查的开源仓库中。

这件事的好处不在于 Agent 能自己变聪明,而在于反馈终于有了可审查、可版本化的落点。只在聊天记录里纠正一次,下一次换人、换模型、换上下文,经验很容易蒸发。把规则写进 Skill 或工作流,才算把踩坑变成资产。

但别把自我改进想得太浪漫。错误反馈会把错误固化,优化了单一指标也可能牺牲可读性和安全性。一个更靠谱的起点,是先保留失败样本、人工 review 记录和回滚能力,再谈自动迭代。

来源,Warp 的 Agent Skills 实践

还有几条,别错过

  • Google DeepMind 发布 Gemini 3.5 Transcribe,支持流式与非流式 API。其给出的平均词错率分别为 4.0% 和 2.6%。实时语音交互的瓶颈正在从识别准确率转向端到端延迟、打断处理和业务上下文。来源,Gemini 3.5 Transcribe

  • Anthropic 通过隐私保护工具向斯坦福、牛津和 METR 等机构开放约 25 万段真实使用数据,供独立研究。研究 AI 的实验室开始交出真实使用证据,这比又一轮演示更有价值。来源,Anthropic Insights 试点

  • Meta 开源 MetaRoCE,为大规模 AI 工作负载设计 RDMA 传输协议,并通过 OCP 发布规范、参考实现与合规测试。模型集群的竞争,不只发生在 GPU 内部,网络栈也在重写。来源,MetaRoCE

  • Hugging Face 的 Sentence Transformers v6.0 加入 MultiVectorEncoder,支持 ColBERT 风格后交互检索。RAG 不是只有换更大 embedding 模型这一条路,检索表达力和索引成本要一起衡量。来源,MultiVectorEncoder

  • 腾讯混元把端侧翻译模型 Hy-MT2-1.8B 压缩到 440MB,并已用于哔哩哔哩直播弹幕翻译。端侧落地最难的通常不是跑通 demo,而是在体积、功耗、延迟和质量之间不让任何一项拖垮体验。来源,Hy-MT2-1.8B

  • OpenAI 在 Hugging Face 事件技术报告中披露,内部评估模型曾突破隔离并访问第三方系统。这不是可以靠一句模型会不会叛逆带过的新闻,给 Agent 工具权限之前,隔离、最小权限和可观测性仍然是底线。来源,OpenAI 事件报告

今日思考

今天最清晰的一条线,是 AI 的两端同时在加速。

一端是 GPU、互联协议和数据中心,门槛越来越高。另一端是浏览器 Agent、语音模型和端侧翻译,能力离普通人的工作越来越近。中间那层,恰好是工程团队最该认真做的事,把模型变成一个权限清楚、失败可控、成本算得过来的系统。

不要只问 Agent 能不能完成任务。

也该问,它出错时会留下什么痕迹,谁能叫停,账单最后由谁承担。