今天最值得盯住的,不是一张新的模型跑分榜,而是 AI 正在同时钻进三台机器。

一台是你的电脑,Claude 开始能在后台替你点按钮。另一台是企业内网,Cursor 把执行器放回了客户自己的机器。还有一台更大,是数据中心,700GW 的排队申请已经把电网规划逼到要重新核验。

模型能力还在涨,但产品真正难的部分,已经变成了权限、执行环境和成本。

今天的主线

1. Claude Code 开始在后台操作电脑

Anthropic 宣布,Claude Cowork 和 Claude Code 可以在后台使用电脑。你把任务交出去后,它会点击、输入、打开应用,你可以继续做别的事。

这听起来像一个小功能,实际是 Agent 交互方式的一次切换。过去的自动化常常卡在「我得盯着它跑」。后台执行把等待从人身上拿走了,但也把审计、权限边界和误操作恢复的要求抬高了。你想想看,一个会替你操作桌面的 Agent,失败时给出一句「已完成」远远不够,过程日志和可撤销动作才是信任的底座。

来源,Claude 官方公告

2. Anthropic 给电商 Agent 的建议很克制

Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现。它给出的方向不是按售前、订单、退款拆一堆子 Agent,而是让一个 Claude 在标准 Agent loop 中调用技能与工具。

我有时候觉得,子 Agent 架构特别容易让人上头。图画得漂亮,职责切得很细,问题是状态怎么传、失败怎么接、评测怎么做,往往比业务本身还复杂。Anthropic 这次的取舍很明确,先把单 Agent 的工具设计和运行循环做扎实,复杂度真的出现了再拆。

不是说多 Agent 不行,而是很多团队还没把一个 Agent 做稳定,就急着开组织架构会。

来源,Anthropic 电商 Agent 实践

3. Copilot 降本,靠的是少看一点无用信息

GitHub 工程师分享了 Copilot 的几项降本改动,其中包括选择性压缩工具输出,以及移除 view 工具的行号前缀。后者在线下推理成本下降约 5%,线上用户日均推理成本下降约 3%。

这组数字不算戏剧化,反而很有价值。Agent 的成本很多时候不在一次大模型调用,而在大量重复的小输入。一个人看代码需要行号,模型未必需要。把每个工具返回的格式都当成可优化对象,积少成多,才会让长任务不至于越跑越贵。

坦率地讲,提示词压缩的上限不高,工具输出治理才是更容易被忽略的杠杆。

来源,GitHub Copilot 成本优化复盘

4. Cursor 把执行器放回企业内网

Cursor 推出 Self-Hosted Machines。规划和推理仍在 Cursor 云端,工具调用则通过 worker 的出站 HTTPS 连接,在企业自己的机器和网络里执行。

这个设计不追求「所有东西都私有化」,而是把最敏感的执行面拉回企业边界。对有内网代码库、测试环境或生产隔离要求的团队,它比把完整 Agent stack 自建一遍更现实。当然,推理仍在云端,数据路径和上下文脱敏依然要逐项确认,别把 Self-Hosted 四个字自动等同于数据从不出门。

回到 Agent 落地这块,能不能连到真实系统,往往比能不能多答两道题更决定采购。

来源,Cursor Self-Hosted Machines

5. Google 从竞赛作品里捞出了四个工程模式

Google 复盘 AI Agents Challenge 的头部提交,归纳出双向 MCP、事件驱动并发、同标准回退和分层路由四种模式。

其中「同标准回退」特别值得看一眼。很多系统有 fallback,但主模型和备选模型拿到的工具、上下文、验收标准并不相同,切换后任务质量就悄悄变了。把约束对齐,才算真正的回退,不是换一个更便宜的模型碰运气。

说真的,Agent 工程到今天已经不缺框架了,缺的是这些不炫但决定可靠性的细节。

来源,Google AI Agents Challenge 复盘

其他值得扫一眼的更新

今日思考

今天这些消息拼起来,有个不那么轻松的结论。

AI 产品正在从「模型够不够聪明」走向「系统能不能被交出去」。电脑操作需要可审计,企业执行需要边界,长任务需要成本控制,电力建设需要辨认真需求。模型会继续刷新分数,但交付一个可以放心运行的 Agent,靠的是一连串并不性感的工程判断。

我自己也还在摸索,不过有一条越来越清楚,别只问 Agent 能做什么。也该问,它在哪儿做、做错后谁能看见、账单最后由谁买单。