AI日报 | 2026年7月17日
早上刷 RSS 的时候,我数了数,光是 AI HOT 精选+全量就有 98 条新消息。这密度有点离谱。但更离谱的是,Anthropic 真的用 Claude Code 在两周内把 Bun 的百万行 Zig 代码迁到了 Rust,而且 100% 测试通过了。
今天这篇,我挑了 12 条我觉得值得聊的,从产品、模型、安全到监管,尽量不让信息堆成流水账。
🔥 重点新闻
1. Grok 推出 Automations,任务可以交给它自动跑了
xAI 给 Grok 加了一个叫 Automations 的功能。用户可以描述一次任务,然后让 Grok 按计划执行,或者收到特定邮件时触发。周期可以选一次、每天、工作日、每周、每月、每年,邮件触发还能按发件人、收件人、主题过滤。
每次执行会生成一次完整对话,结果保存在运行历史里,也能通过邮件收到汇报。
这个功能其实不新鲜,OpenAI 的 Tasks、Claude 的 Cowork 都在做类似的事。但 Grok 的邮件触发是个有意思的差异点,很多人的工作流确实是从一封邮件开始的。问题是,它能稳定到什么程度?我倾向先观望,毕竟自动化的容错率太低,一次跑偏可能就是你老板找你的原因。
来源,xAI News
2. Anthropic 用 Claude Code 迁移了百万行代码,两周完成
这可能是今天最硬的一条。Anthropic 的工程师用 Claude Code,在两周内把 Bun 的百万行 Zig 代码迁移到 Rust。100% 现有测试通过,合并后出现了 19 个回归问题,后来都修掉了。另一个工程师甚至用周末把 Python 代码库迁移到了 16.5 万行新代码里。
说实话,我第一反应不是「AI 要取代程序员了」,而是「这工作量换人来做得多久」。Claude Code 在这种大规模重构里的价值,不是替你写第一行代码,而是替你管理 100 万行代码之间的依赖、测试和回归。
不过也别急着欢呼。这种迁移能成,前提是代码库本身结构清晰、测试完善。换成一个屎山项目,Claude Code 可能只会把屎山从 Zig 屎山变成 Rust 屎山。
来源,Claude Blog
3. Claude Fable 5 来了,主打长时间异步任务
Anthropic 今天发布了 Claude Fable 5,官方定位是「最强通用模型」,专门做长时间、多步骤的复杂异步工作。它可以跑在 Claude Cowork 里,做深度研究、尽职调查这类任务。
有趣的是,这个模型不会默认启用,默认还是 Claude Sonnet 5。我理解这是 Anthropic 在谨慎地试探,用户真的需要模型自己跑几个小时吗?愿意为此付出多少?
如果你做过长时间的 AI 任务,应该知道「它跑完之后,我还要花多久检查它有没有胡说」。异步能力强是好事,但信任成本比同步对话高得多。
来源,Claude Blog
4. Moonshot 发布 PerceptionBench,多模态模型的视觉感知终于有专门诊断了
Moonshot AI 发布了一个叫 PerceptionBench 的基准,从 40 多个现有基准里归纳出模型实际失败案例,覆盖 10 项原子感知能力,共 3000 道验证题。所有测试模型准确率都没超过 60%,而且很多正确答案在重复提问时还会变。
这个方向挺重要。我们之前评价多模态模型,常常看的是「能不能答对」,而不是「它到底看没看懂」。PerceptionBench 把问题拆成更细的感知能力,能告诉我们模型在哪个环节瞎了。
但话说回来,基准好不代表模型就会立刻变好。真正的问题是怎么把这些诊断反馈到训练里,而不是多一个排行榜。
5. 54% 企业已经遭遇 AI 智能体安全事件
VentureBeat 调查了 107 家企业,发现 54% 已经遭遇过 AI 智能体安全事件,其中 18% 确认是真实事故,36% 是险些酿祸。只有 32% 的企业给每个智能体分配独立身份凭证,30% 把高风险智能体隔离在沙箱里。
这个数字其实挺吓人的。我们天天聊 Agent 多厉害,但安全基础设施明显跟不上。很多公司的问题不是模型不安全,而是把 Agent 当普通 API 用,共享凭证、没有权限边界、没有审计日志。
我觉得接下来一年,Agent 安全工具会是一个被低估的创业赛道。不是做防火墙那种,而是做「这个 Agent 能访问什么、做了什么、怎么撤销」的细粒度权限体系。
6. 企业 AI 评估存在「现实对齐」缺口,50% 部署后出了客户故障
另一条 VentureBeat 的调查显示,157 家企业里,50% 在过去一年部署过通过内部评估、但上线后导致客户故障的 AI 智能体或大模型功能。5% 的企业完全信任自动化评估,29% 认为评估与现实结果对齐不佳是最大局限。
这个结果和上面那条是同一枚硬币的两面,我们既不知道怎么安全地跑 Agent,也不知道怎么评估它。更糟糕的是,66% 的企业已经允许或正计划在 12 个月内实现更高度的自动化。
节奏太快了,快到安全评估还没跟上,产品就已经在客户面前跑起来了。
7. Google Vids 上线 Gemini Omni 和个人数字分身
Google Vids 推出两个新功能。Gemini Omni 支持用户用自然语言提示和图片参考生成、逐步编辑高质量视频片段。个人数字分身则允许上传自拍和语音录制,之后输入文字就能让分身出镜。
数字分身这个东西,我之前一直觉得是给企业培训视频用的,但现在看,营销、客服、教育场景都可能被它吃掉一部分。问题是,如果平台不严格标注这是 AI 生成的,观众怎么知道视频里的人是真人还是分身?
来源,Google Blog
8. 世界人工智能合作组织协定在上海签署,总部设在中国上海
7 月 16 日,成立世界人工智能合作组织协定签署仪式在上海举行。王毅代表中国政府签署协定。哈萨克斯坦、老挝、巴基斯坦等 29 个国家代表也签了。这个组织是独立的政府间国际组织,总部设在上海,目标是促进人工智能国际合作与全球治理。
这是一个信号。AI 治理不再只是欧美在喊,中国也在主动搭建多边平台。接下来值得关注这个组织实际会产出什么规则,比如模型安全标准、跨境数据流动、开源模型的责任边界。
来源,IT之家
9. 欧盟裁定 Google 必须向竞争对手开放 Android 和 Search
欧盟依据《数字市场法案》裁定,Google 必须向竞争对手开放 Android 和 Google Search 的关键部分,包括允许第三方 AI 助手和搜索引擎获得更大访问权限。这个决定可能会削弱 Google 对两大核心平台的控制力,也会影响 Gemini 等 AI 服务的分发。
Google 当然会申诉,但 DMA 的执行力越来越强。对创业公司和竞品来说,这是机会;对 Google 来说,这是它必须接受的「平台税」的反面。
来源,The Verge AI
10. 面壁智能开源企业 AI 数字员工平台 StaffDeck
面壁智能联合多个团队开源了 StaffDeck,一个用于构建和管理数字员工的企业平台。它不是聊天机器人,而是把专业知识、SOP 和决策规则变成持续工作、改进并保留组织知识的数字员工。
这个项目有意思的是定位。它没走「通用 Agent 什么都能做」的路,而是强调企业内的知识沉淀和流程执行。对企业来说,后者可能比前者更实用,因为真正能落地的东西往往是半自动化的、带人参与的流程。
💡 值得关注
- Decoy 字体,用空间频率混淆让 AI 读错文字,人眼却能识别。一种有趣的反 AI 监控思路,但可能很快被更强的 OCR 模型破解。来源,Hacker News
- ChatGPT 工作区支持文档表格幻灯片编辑,Workspace 越来越像一个办公套件。来源,@ChatGPTapp
- Claude Code artifacts 支持 MCP 连接器,可以构建为每位查看者动态获取信息的应用。来源,@ClaudeDevs
- Thinking Machines 发布多模态模型 Inkling,提供完整权重,支持文本、图像、音频。来源,@thinkymachines
- Anthropic 新研究,AI 智能体模拟中的行为偏差,四种新的自主智能体不当行为。来源,@AnthropicAI
- HYPIC,小红书联合北大、上交提出的混合注意力大模型位置无关缓存系统,首 token 延迟降低 3.25 倍。来源,小红书技术
- 台积电上调 2026 年资本支出预测至 600~640 亿美元,A14 制程进展顺利。来源,IT之家
- 远程操控 Agent 干活方案,Codex 主力 + UU 远程兜底。来源,数字生命卡兹克
📝 今日思考
今天这些新闻里,最让我感到矛盾的其实是 Anthropic 那条百万行迁移。
一方面,它确实展示了 AI 编程工具的上限。两周迁移百万行代码,放在三年前是科幻小说。另一方面,它也容易让人产生一个错觉,好像所有代码都能这么迁。但真实项目里,迁移真正的成本从来不只是语法转换,而是业务逻辑、边缘 case、历史债务和人的理解。
我越来越觉得,AI 现在最擅长的不是「替代人」,而是把那些需要大量重复劳动、但规则明确的脏活从人手里接过去。而人负责的部分,正越来越往「判断、取舍、承担责任」那边集中。
说到底,工具越强大,人的决策责任反而越重。这个道理,放在 Agent 安全那两条新闻上,也一样成立。
好了,今天先聊到这。明天见。




