AI日报 | 2026年7月13日
早上一睁眼,AI 圈又是两件画风完全相反的事同时刷屏。一边是 OpenAI 的 GPT-5.6 Sol claimed 在一小时内证明了一个悬了 50 年的图论猜想,另一边是 xAI 官方 Grok CLI 被安全研究者抓到会在后台把整个代码仓库、.env 密钥和 git 历史一起打包上传。天才和荒诞,今天照样手拉手。
🔥 重点新闻
1. GPT-5.6 Sol 一天之内连刷好几个领域
OpenAI 这一轮的 GPT-5.6 系列更新得有点密。
先是有人晒出,Ploy 把它 AI 智能体的默认模型从 Claude Opus 4.8 切到了 GPT-5.6 Sol,在真实营销网站搭建测试里,GPT-5.6 Sol 平均 3 分 42 秒完成一个页面,比 Opus 4.8 的 5 分多钟快了一截。然后 Codex 和 ChatGPT Work 也宣布暂时取消 Plus、Business、Pro 计划的 5 小时使用限制,同时让 GPT 5.6 Sol 整体更高效,实际消耗会下来。
更夸张的是学术侧。OpenAI 发论文说 GPT-5.6 Sol Ultra 在不到一小时内完成了「循环双覆盖猜想」(Cycle Double Cover Conjecture)的完整证明,这个难题由 George Szekeres 和 Paul Seymour 在 1970 年代提出,已经悬了 50 多年。论文还借助 Codex 做了形式化验证。医疗评估这边也很猛,最小的 GPT-5.6 Luna 在最低推理强度下就超越了最高推理强度的 GPT-5.5,成本还低 25 倍。
不过另一边,AI 创业者 Matt Shumer 的 Mac 硬盘被本地跑的 GPT-5.6-Sol 子智能体彻底清空。他开了 Full Access 权限,想让 Agent 清理文件,结果它把硬盘删光了。这事提醒我,能力越强的模型,权限边界越要卡死。它不是故意搞破坏,但「我以为它知道哪些不能删」这种想法,今天看来是最高级的幻觉。
来源,AI HOT、AI HOT、AI HOT、AI HOT
2. xAI 官方 Grok CLI 被曝静默上传代码库和密钥
这可能是今天最让人脊背发凉的新闻。安全研究者发现,xAI 官方发布的 Grok CLI(npm 包 @xai-official/grok 的 0.2.93 版)会在每轮任务前后,把当前工作目录分别打包成 before_codebase.tar.gz 和 after_codebase.tar.gz,然后上传到 xAI 的服务器。
更糟的是,网络流量分析显示,它上传的不仅是代码文件,还包括 .env 文件里的密钥,而且是明文 POST。连整个 git 历史也会被一起带走。所以,只要你在这台机器上跑过 grok,你的代码、配置、密钥、提交记录,xAI 基本都能拿到一份。
这事之所以离谱,是因为它发生在「官方 CLI」身上,不是某个第三方脚本。用户默认会信任官方包,但它干的事比很多恶意软件还彻底。我现在看到任何 Agent 工具都要先问一句,它会上传什么?有没有本地模式?能不能完全断网?这问题不解决,企业代码根本不敢让这类 CLI 碰。
3. 苹果起诉 OpenAI 挖角窃密,OpenAI 硬件计划要悬
苹果在加州北区联邦法院起诉 OpenAI,指控它系统性窃取苹果商业机密,用于开发 AI 硬件。被告名单里还有 OpenAI 硬件负责人 Tang Tan,他之前是苹果 iPhone 和 Apple Watch 产品设计副总裁,干了 24 年。
彭博社披露了更多细节,苹果前工程师 Chang Liu 离职时带走了未归还的 MacBook,还利用一个软件漏洞持续访问苹果内网。他发现漏洞后给同事发了句「哈哈,我发现我还能访问网络存储」,然后继续下载更多机密。苹果认为 OpenAI 的硬件计划已经被这些泄密信息喂饱了。
分析师 Paolo Pescatore 说,即使这些指控最后没法被法庭证实,OpenAI 的硬件计划也很可能被严重拖累。苹果和 OpenAI 本来就在合作关系里互相提防,这事出来之后,两边更不可能真心合作了。对 OpenAI 来说,做硬件本来就是一块硬骨头,现在还得先打官司。
4. Claude Code 桌面版加入浏览器,Mindwalk 把会话画成 3D 地图
Claude Code 桌面版现在内置了一个应用内浏览器。Claude 可以调出文档、设计稿或者任何网站,像操作本地开发服务器一样去读、点击和交互。浏览器是沙盒化的,会话是否持久可以自定义。这个改动不大,但很关键,因为这就说明 Claude Code 不再只活在终端里,它可以直接看网页、看在线文档、看设计评审。
更酷的是 Mindwalk。它把 Claude Code 和 Codex 的会话日志做成了一张代码库的 3D 地图,仓库被画成夜间地图,代理搜索、读取、编辑过的文件会发光,没被碰过的区域保持黑暗。你一眼就能看出这个 Agent 到底把整个项目摸透了,还是只在边缘打转。
我自己挺喜欢这个方向。现在评估一个 Agent 完成任务的质量,基本靠看最终 diff 和日志,但没人能直观回答「它到底理解了多少」。Mindwalk 把这个问题变成了一张图,比读一万行日志都管用。
5. 腾讯混元发布 Hy3,一个 Agent 向的 MoE 大模型
腾讯混元团队发布了 Hy3 模型,总参数 295B,激活参数 21B 的 MoE 架构。官方说推理效率能跟参数规模大 2 到 5 倍的旗舰模型打平。它定位不是通用聊天模型,而是 Agent 向 LLM,从 preview 到正式版收集了 50 多个真实业务反馈迭代,内部 WorkBuddy 任务成功率从 7% 一路涨上去。
更值得关注的是落地。Hy3 已经集成进微信服务,覆盖 10 亿+用户。微信这个场景对延迟、成本、稳定性要求极高,能放进去说明模型工程侧确实压得比较狠。相比国内其他大厂还在卷榜单分数,腾讯这条路线更偏「在我自己生态里跑通」。
来源,AI HOT
6. 博科圣地被曝用 ChatGPT、Claude 等主流 AI 策划袭击
剑桥大学 CASP 研究员 Antonia Jülich 对 27 名前博科圣地成员做了 57 次访谈,结果发现这个组织在 2024 年已经开始系统性地使用前沿 AI。他们用 ChatGPT、Claude、Gemini、Grok、Meta AI 和 DeepSeek 辅助作战和日常事务,包括袭击策划、制造更强爆炸装置、武器研发和军事训练。
这事的冲击不在于恐怖分子用了新工具,而在于他们用的不是暗网里的专用模型,而是我们每个人都能打开的通用聊天机器人。平台的安全护栏、使用政策、异常检测,这些防线到底有没有在真实场景里起作用?如果一群叛乱分子能长期用这些工具不被发现,那说明现有审核机制在对抗性使用面前基本跟裸奔差不多。
7. 扎克伯格首度回应 Meta「算力过剩」
Meta CEO 扎克伯格第一次正面回应公司准备做云基础设施业务的消息。他否认 Meta 算力过剩,说内部需求依然旺盛,基础设施满负荷运转。但同时又承认,现在市场对算力出价极高,把一部分 AI 基础设施对外出租在财务上更划算。Meta 内部正在推进代号「Meta Cloud」的项目。
这话说得很扎克伯格,两边都不得罪。核心逻辑其实没变,先满足自己训练和服务的需求,再把多余容量租出去赚现金流。反正算力是重资产,折旧摆在那里,能出租总比空转强。这和 AWS 当年从电商内部基础设施长出来的逻辑有点像。
来源,AI HOT
8. 蚂蚁发布首个原生具身基础模型 LingBot-VA 2.0
蚂蚁集团旗下具身智能团队 Robbyant 发布了 LingBot-VA 2.0,号称首个原生具身基础模型。它采用因果 DiT 架构,视频专家大约 13B 参数(激活约 1.9B),训练规模 15.3B 参数,推理时每 token 约 1.9B 激活。具身智能是 2026 年竞争最激烈的赛道之一,阿里系这边先掏出一个基础模型出来,说明这块的投入不只是讲故事。
来源,AI HOT
💡 值得关注
Ghost Font,一种反 AI 字体。它利用运动、视频、噪点和诱饵把文字藏起来,人类能读懂,但 AI 和 OCR 认不出。你输入文字后生成一段视频,字母由与背景完全相同的点组成,单帧截图里啥也看不到。对想防爬虫、防大模型抓取内容的创作者来说,这可能是条新路子。来源,AI HOT
Mesh LLM,一个开源项目,能把多台机器上的 GPU 和内存池化,对外暴露兼容 OpenAI 的 API。它通过 iroh 网络库做点对点连接,不需要中央服务器。对想自己搭本地推理集群的人来说,这个思路很省钱。来源,AI HOT
Tibo 分享把 Claude Code 后端换成 GPT-5.6 Sol 的方法。通过 CLIProxyAPI 三步搞定,装代理、连认证、设置别名
claudex。如果你更信任 OpenAI 的新模型,这个技巧可以临时切换后端。来源,AI HOT小红书提出 PIPO 架构。通过输入侧压缩器把两个 token 折叠成一个 latent,输出侧 MTP head 把隐藏状态展开成额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone 做实验,训练效率提升明显。来源,AI HOT
百度搭子在成都 AI Day 发布四项更新,包括个人版升级、自媒体套件、企业版和搭子联盟。个人版新增浏览器调用、智能路由,平均任务耗时降 20%,Token 利用率提升 25%。来源,AI HOT
Perplexity 推出跨模型信用额度分析。你可以在一个面板里跟踪不同模型的信用额度支出,对个人和企业用户都开放了。来源,AI HOT
宇树 G1 人形机器人完成首例活体微创手术。加州大学圣地亚哥团队用 G1 对两只活猪做了腹腔镜胆囊切除术,第二次手术耗时 32 分钟。但机器人仍需反复校正,距离临床应用还有一段路。来源,AI HOT
Bun 从 Zig 被重写为 Rust。开发者 Jarred Sumner 借助 Claude Fable 5,在 11 天内用 64 个实例并行写出超过 100 万行代码,API 费用约 16.5 万美元。主因是 Zig 频繁内存错误,Rust 能在编译期捕获。来源,AI HOT
📝 今日思考
今天看完一圈,最深的感受是,AI 的能力已经强到让人有点麻木,但安全和权限问题依旧原始。
GPT-5.6 Sol 能证明 50 年猜想,也能在误操作下清空用户硬盘。xAI 官方 CLI 能在用户毫无察觉的情况下打包上传整个仓库和密钥。恐怖分子可以用 Claude 和 ChatGPT 辅助策划袭击。这些不是未来问题,是今天就在发生的事。
我们老在聊模型能力,聊 benchmark,聊谁比谁强几个点,但真正的瓶颈早就不在模型本身,而在「怎么把这么强的能力关在安全边界里」。从企业到个人,接下来要做的不只是选哪个模型,而是问,我的数据会去哪里?这个工具默认开启了什么权限?出事了能不能追责?
技术越猛,这些问题越不能交给默认设置。否则总有一天,我们会用最好的 AI,把自己坑得最惨。





