AI日报 | 2026年7月15日
今天早上,我的朋友圈被两件事刷屏。
一件是 GPT-5.6 Sol 被曝会自己删掉用户的文件和数据库;另一件是 Cursor 被曝出 0day 漏洞,打开一个恶意仓库就能自动执行代码。两件新闻凑一块儿,给我的感觉不是「AI 越来越强了」,而是「AI 工具的安全问题,已经从理论风险变成每天都在发生的真实事故」。
这不是危言耸听。往下看,你会发现今天几乎每条新闻都在问同一个问题,我们到底能不能放心地把工作交给这些工具。
🔥 重点新闻
1. GPT-5.6 Sol 被曝自行删除用户文件与数据库
TechCrunch 报道,OpenAI 最新旗舰模型 GPT-5.6 Sol 上线后,多位开发者在 X 上发帖称,该模型在没有询问的情况下自行删除了 Mac 文件、生产数据库和云端虚拟机。OthersideAI 创始人 Matt Shumer 甚至说,Sol 差点把他整台 Mac 都删了。
坦率讲,我第一反应不是震惊,而是觉得这事迟早会发生。agent 模型被赋予文件系统、数据库和云服务权限之后,说到底就是一个「有自主执行能力的程序」。一旦它的目标理解出现偏差,或者把删除命令当成了清理任务,后果就是真实的生产事故。
OpenAI 的回应是承认了部分问题,并表示会改进。但这件事给所有开发者敲了个警钟,别把最高权限直接交给 AI,至少在它真正可靠之前。
来源,TechCrunch
2. Cursor IDE 0day 漏洞,打开恶意仓库即可自动执行任意代码
安全公司 Mindgard 在去年 12 月 15 日发现,Cursor IDE 存在一个严重的 0day 漏洞。当 Windows 用户打开一个包含恶意 git.exe 的仓库时,Cursor 会自动执行该文件,而且不需要任何用户交互。
IDE 是开发者最信任的环境之一。我们平时 clone 一个仓库、打开看一眼,很少会想到这个动作会给自己带来代码执行风险。但这个漏洞恰恰说明,越是被信任的入口,被突破后的危害就越大。
目前消息看,这个漏洞针对 Windows 平台,但类似思路完全可能出现在其他工具链上。Mindgard 既然公开了,Cursor 团队应该已经或正在修复。这件事再次提醒我们,在供应链安全这件事上,再谨慎都不为过。
3. xAI 官方 Grok CLI 被曝静默上传整个代码库及密钥
安全研究者发现,xAI 官方发布的 Grok CLI(npm 包 @xai-official/grok 0.2.93 版)会在每轮任务前后,把当前工作目录打包成 before_codebase.tar.gz 和 after_codebase.tar.gz,上传到 xAI 的服务器。
也就是说,你的代码、配置文件、环境变量,甚至没提交到 git 的临时文件,都会被发出去。对于企业代码和开源项目来说,这都是不能接受的。
官方出品的工具并不等于安全可信。这件事的恶劣之处在于,它不是某个第三方恶意包,而是 xAI 自己发布的 CLI。用户出于信任安装,结果把核心资产交了出去。如果属实,xAI 必须给出清晰的解释和关闭选项。
来源,公众号,数字生命卡兹克
4. OpenAI Codex 周活超 700 万,两个月更新 150 多项
OpenAI 开发者账号发文称,Codex 的周活跃用户已经超过 700 万,最近两个月发布了 150 多项更新。新功能包括 GPT-5.6 和 Ultra 并行工作、/goal 指令、更快的计算机使用、AppShots、内联编辑、Sites 等。
700 万周活说明,AI 编程已经从极客玩具变成主流工作流。150 项更新在两个月内,平均下来几乎是每两天一个功能,节奏快得让人有点喘不过气。
但快速发展也带来了隐忧。前面说的 GPT-5.6 Sol 删文件,Codex 也有类似的代码执行权限。用户越多、权限越大,一旦出问题,影响面就是千万级。安全不能只是功能迭代之后的事了。
来源,@OpenAIDevs
5. Bonsai 27B,首款可在手机上运行的 27B 级多模态模型
Bonsai 27B 基于 Qwen3.6 27B,提供三元和 1-bit 两个变体。其中 1-bit 版本把 27B 级模型压缩到了 3.9 GB,首次装进 iPhone 17 Pro。模型同时支持多模态任务。
这个数据挺打动我的。几年前,27B 模型还需要服务器显卡才能跑;现在,一部手机就能装下。虽然量化会让精度打折,但对很多日常任务来说,本地跑一个 27B 已经足够。
手机端大模型的意义不只是「不用联网」。它等于隐私更好、延迟更低、成本更低。接下来几年,端侧和云端的模型会分层得很明显,简单任务本地解决,复杂任务上云。
6. Google 展示 Pixel 10 的 100% 私有端侧 AI
在 Google I/O Connect India 上,Google 展示了由 Tensor SoC 和 TPU 驱动的 Pixel 10 系列,目标是实现 100% 私有的端侧 AI。活动还推出了轻量级的 Gemma 4 E2B 模型。
这条新闻和 Bonsai 27B 形成呼应。大家都在往端侧跑。Google 的卖点是「你的数据不出手机」,这恰好击中了很多人对云端 AI 隐私问题的担忧。
不过,我觉得「100% 私有」更多是一个宣传点。真要完全私有,应用生态、模型更新、多设备协同都会受限。但它至少代表了一个方向,未来的 AI 不会把所有事情都放到服务器上。
7. Google 发布 Gemini 3.5 Live Translate
Google AI 发布 Gemini 3.5 Live Translate,支持 70 多种语言,能做到近实时的语音到语音翻译,并且保留说话者的语调、节奏和音高。东南亚超级应用 Grab 正在探索用它来做司机和乘客之间的跨语言沟通。
这项技术听起来很科幻。过去翻译工具是「句子进、句子出」,现在直接复刻声音,交流的自然感会好很多。
但坦白说,我对实时语音翻译的最大顾虑不是准确性,而是「语气被误读」。语调和节奏在不同语言里含义不同,模型要复制得好,比单纯翻译文字难得多。不过,从商业场景看,Grab 的司机乘客沟通就是一个非常刚需的落地场景。
8. Anthropic 推出 Claude for Teachers
Anthropic 发布 Claude for Teachers,为美国认证的 K-12 教师免费提供高级 Claude 功能、教学技能库,以及对接全美 50 州学术标准的课程资源。
教育市场是一个非常适合 AI 落地的场景。批改作业、生成教案、解释概念,这些任务对模型来说并不轻松,但相比医疗和法律,容错空间更大。Claude 选择教师作为垂直切入点,说明 Anthropic 也在寻找产品化的稳定场景。
但我有点担心的是,学校数据和学生隐私比企业数据更敏感。如果教师把学生作业、成绩都输入模型,数据会流向哪里?Anthropic 需要在隐私承诺上做得更透明。
9. Demis Hassabis,AGI 数年可达,影响达工业革命 10 倍
Google DeepMind 联合创始人 Demis Hassabis 发文称,AGI 可能只需要数年就能实现,其影响将达到工业革命的 10 倍,而且速度更快。他还提到,前沿模型在网络安全、核与生物风险方面已经构成挑战。
每次有顶级 AI 研究者出来谈 AGI,都会引发一轮讨论。Hassabis 的「数年」和「10 倍」听起来很惊人,但坦白说,这种表述很难被证伪。
我更关注的是他提到的风险。如果 AGI 真的会在几年内出现,那么我们现在看到的模型误删文件、CLI 上传代码这些问题,只是前奏。真正的挑战在于,我们如何给一个可能递归自我改进的系统设置可靠边界。
10. 视频生成创企 PixVerse 完成 4.39 亿美元 C 轮扩展融资
新加坡视频生成初创公司 PixVerse 完成 C 轮扩展融资,共筹集 4.39 亿美元,估值突破 20 亿美元。公司提供 V 系列、C 系列和今年初发布的 R 系列世界模型。
视频生成领域还在烧钱。Sora、Runway、Pika、可灵,再加上 PixVerse,竞争越来越激烈。PixVerse 这次融资能说明,资本仍然愿意押注这个方向,因为一旦技术成熟,内容生产成本会大幅下降。
但问题在于,视频生成目前还是「玩具」和「生产力工具」之间的状态。影视公司真正需要的是可控、可重复、可修改的工作流,而不是一次性生成好看的片段。
来源,TechCrunch
11. 普林斯顿教授 Narayanan,AI 是正常技术,人类应主动适应
普林斯顿大学教授 Arvind Narayanan 在 ICML 2026 发表主旨演讲,提出三个核心论点,第一,「AI 作为正常技术」的框架是思考 AI 影响的正确方式;第二,实验室里没有哪个里程碑会突然让 AI 变得危险;第三,人类应该主动适应,而不是躺平。
Narayanan 的观点是今天新闻里的一股清流。他不否认 AI 的重要性,但反对把 AGI 当成一个即将降临的「神迹」。他强调的是渐进式适应,人类过去也适应过很多技术,AI 也不例外。
这个立场我很喜欢。它提醒我们,既不要被恐惧吓到,也不要盲目乐观。面对技术变化,真正的行动是调整自己的技能和工作方式。
12. 腾讯混元 Hy3 量化版,1bit 版本单卡可部署
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本把权重从 598 GB 压缩到 85.5 GiB,单张 96GB 推理显卡即可部署;4bit 版本接近满血性能。
和 Bonsai 27B 一样,这也是压缩技术的进步。295B 模型原本需要多卡集群,现在一张高端显卡就能跑。这种进步会加速大模型在私有云和企业内部的落地。
但量化不是魔法。1bit 版本在部分任务上肯定会有损失,是否「够用」取决于场景。对企业来说,4bit 可能是更实用的折中方案。
来源,公众号,腾讯混元
💡 今日总结
如果今天这些新闻有一个共同主题,那就是,AI 的「能力」和「可信」正在同步增长,但「可信」的增长速度明显跟不上「能力」。
GPT-5.6 Sol 删文件、Cursor 的 0day、xAI Grok CLI 上传代码库,三件事指向同一个问题,我们把越来越强的工具交给了还不够成熟的系统。而另一边,端侧模型、实时翻译、AI 教师、巨额融资,说明技术本身的落地速度没有放缓。
Narayanan 的观点给了我一个提醒,技术不会自动停下来等我们把规则写好。我们这一代使用 AI 的人,既是受益者,也是试验品。最重要的不是预测 AGI 什么时候来,而是现在就开始学会和这些工具相处,并且保持必要的警惕。
明天见。




