2026年7月16日,AI 圈同时上演了两出相反剧情。一边是 xAI 把自家编程智能体 Grok Build 整仓开源,另一边是 OpenAI 用 AI 自己攻击自己,并且 Cursor 被曝出连一个”打开仓库就执行恶意代码”的简单漏洞都没修。开源、安全、本地化,这三个词今天被反复敲打。

🔥 重点新闻

1. xAI 开源 Grok Build,终端编程智能体可以本地跑

Grok Build 是 SpaceXAI 的终端 AI 编程智能体。7 月 16 日,xAI 把它的完整代码扔到了 GitHub 上。仓库 README 写得很直接,它是个全屏 TUI,能读代码库、改文件、跑 shell、搜索网页、管理长任务。可以交互式使用,也可以无头跑脚本或 CI,还能通过 ACP 嵌进编辑器。

技术栈是 Rust。目前仓库已经有 2.7k+ Star、384 个 Fork。更重要的是,它支持自己编译、本地推理,配置写在 config.toml 里就能完成。官方安装脚本也支持 macOS、Linux 和 Windows。

这事的意义不只是”又多了一个开源 Agent”。它把”xAI 的模型 + 一个完整的终端交互层”一次性放出来了。Codex 有 CLI、Claude Code 有 TUI,但能把整套 Agent 循环、工具、界面和扩展系统全开源的,目前仅此一家。如果你反感云端依赖,或者想在自己机器上搭一条完全可控的编码流水线,这仓库值得你克隆下来看看。

来源,GitHub xai-org/grok-buildx.ai/cli

2. Thinking Machines Lab 发布 Inkling,975B 参数的开源权重多模态模型

7 月 15 日,Thinking Machines Lab 发布了首个从头训练的模型 Inkling。官方的说法是,它不是当前最强的模型,但是一个好的开源权重基础。

参数很夸张,975B 总参数、41B 激活,MoE 架构。上下文窗口 1M token。预训练数据 45 万亿 token,涵盖文本、图像、音频和视频。它在 Agentic 编程、工具使用、多模态和音频评测上都有竞争力,但刻意不走”单一 benchmark 刷分”的路线。

我注意到两个有意思的点。第一,Inkling 同时在 Tinker 平台上开放微调,官方还演示了”让 Inkling 自己给自己写微调任务、跑训练、评估结果”。第二,它公开承认”不是最强”,这种克制比一味堆参数更少见。开源权重的战争已经从”谁的分数高”转向”谁能成为别人愿意二次开发的基础”,Inkling 显然想走后面这条路。

来源,Thinking Machines Lab 官方博客

3. OpenAI 用 GPT-Red 自己攻击自己,成功率 84% 远超人类

OpenAI 公布了内部红队模型 GPT-Red。它的任务是在部署前自动找漏洞,比如提示词注入、邮件或文件里藏恶意指令。训练方式是对抗自博弈,一个攻击者模型不断尝试攻破,一个防御者模型不断阻挡,两边一起升级。

测试结果很直接,GPT-Red 在测试场景里成功率 84%,人类红队只有 13%。它甚至能在 OpenAI 办公室里的一个 AI 售货机上改价格、取消别人的订单。OpenAI 把这些攻击数据喂给 GPT-5.6 Sol 做对抗训练,使得后者在直接提示词注入上的失败率降到四个月前最佳模型的六分之一。

不过先别急着庆祝。The Decoder 的报道也提到,更强的提示词注入仍有约 3.8% 的成功率。攻击没有归零,只是把门槛抬高了一截。Agent 能做的事情越多,能捅的篓子也越大,这个张力还会持续很久。

来源,The Decoder 对 OpenAI GPT-Red 的报道

4. Cursor 0day 漏洞,打开带毒仓库就能执行任意代码

Mindgard 披露了 Cursor 的一个 0day。漏洞简单到有点离谱,在 Windows 上,Cursor 打开项目时会去多个路径找 git 二进制文件,其中一个路径就是当前仓库根目录。如果攻击者在仓库根目录放一个恶意的 git.exe,Cursor 会没有任何提示、不需要用户点击,直接执行它。

更离谱的是,这个漏洞最早在 2025 年 12 月 15 日就被报告,Cursor 6 个多月、197 多个版本过去了依然没有修复。Mindgard 放了 PoC,把 Windows 计算器重命名为 git.exe 放进仓库,Cursor 打开后不断弹出新计算器窗口。

Cursor 目前有 700 万+ 月活、100 万+ 日活、100 万+ 付费用户、5 万+ 企业客户。这么大的体量,对这么一个基础安全问题沉默半年,确实说不过去。临时缓解方案是在 Windows 上用 AppLocker 或 WDAC 限制仓库根目录的可执行文件,或者只在虚拟机/Windows Sandbox 里打开不信任仓库。

来源,Mindgard 安全博客

5. 国行 Apple 智能完成备案,阿里千问将集成进苹果 AI

网信办新增”Apple 智能”等 7 款手机端侧生成式 AI 服务备案。其中苹果技术开发(上海)有限公司的”Apple 智能”大模型在 7 月 8 日完成备案,适用场景为苹果手机。阿里千问将作为 AI 能力集成到 Apple 智能里,为 iOS、iPadOS、macOS 和 visionOS 的中国用户提供服务。

有一件事已经清楚了,国行 iPhone 的 Apple Intelligence 上线终于进入倒计时。对国内用户来说,最关心的问题可能是,数据留在哪儿、谁来管、体验跟海外版差多少。苹果选阿里千问做能力底座,说明它在中国市场的合规路径已经明确走”本土模型 + 本地备案”这条路。

来源,IT之家

6. déjà-vu,一个给编程智能体做长期记忆的零依赖工具

GitHub 上出现了一个叫 déjà-vu 的开源项目,专门解决 Claude Code、Codex、opencode 这些智能体”跨会话失忆”的问题。它读取这些工具本来就会写的 session log,在上面加一层记忆,搜索、MCP 回忆、自动上下文、敏感信息脱敏、统计都有,还支持通过 SSH 在不同机器间同步。

它被打包成一个零依赖的单一二进制文件。对于经常在多台机器上切换、又想让 Agent 记住项目习惯的人来说,这比把记忆交给某个闭源云服务要舒服得多。

来源,GitHub vshulcz/deja-vu

💡 值得关注

📝 今日思考

今天的新闻拼出一幅挺矛盾的图景。开源把 Agent 的钥匙交到你手里,红队模型和安全漏洞又提醒你,这把钥匙能打开的门,也可能让风险溜进来。Grok Build 和 déjà-vu 代表”我想自己掌控”,GPT-Red 和 Cursor 0day 代表”你其实没那么安全”。

我自己的感受是,2026 年 AI 的下一步,不再是”谁更强”,而是”谁更可控”。模型能力的差距在缩小,但可控性的差距,开源程度、安全响应、本地部署、记忆归属,才刚刚开始拉大。这个维度,可能比 benchmark 更值得长期关注。