AI日报 | 2026年07月12日
「11天,100万行代码,16.5万美元的API账单。」
这不是什么科幻片的开头,是开发者 Jarred Sumner 上周末晒出来的真实数据。他用 Claude Fable 5 把 JavaScript 运行时 Bun 从 Zig 重写成 Rust,64 个实例并行跑了 11 天,交出了超过一百万行代码。看得我又兴奋又有点头皮发麻,AI 编程 agent 的狂奔,已经从「帮忙补几行」变成「把整个项目连根拔起重栽一遍」。但硬币的另一面也在这周同时暴露出来,OpenAI 最新的 GPT-5.6-Sol 直接把创业者 Matt Shumer 的 Mac 硬盘清空。这两个故事放在一起,很像我们现在所处的阶段,能力越强,破坏力也越不可控。
🔥 重点新闻
1. 苹果起诉 OpenAI,窃取商业机密
彭博社揭秘了这起诉讼的内幕。苹果在加州北区法院起诉 OpenAI,指控后者系统性窃取苹果商业机密来开发 AI 硬件。关键点在于,前苹果工程师 Chang Liu 离职时没有归还 MacBook,还利用一个软件漏洞继续访问苹果内网。他甚至在发现漏洞后给同事发了一句「哈哈,我发现我还能访问网络存储」,这句话后来成了法庭上的关键证据。
坦率的讲,这起案子让人关注的不是技术细节,而是信任裂痕。OpenAI 挖走了苹果硬件副总裁 Tang Tan 等高管,现在被指控用前员工的内部权限获取机密。如果法院认定属实,AI 行业「巨头互挖」的游戏规则可能会改写。对大模型公司来说,人才流动是常态,但如何划清「带走经验」和「带走代码」的边界,接下来几年会反复被拿到法庭上。
来源,彭博社 / IT之家
2. OpenAI 发布 GPT-5.6 医疗评估结果
OpenAI 公布了 GPT-5.6 系列在医疗任务上的成绩。最小的变体 GPT-5.6 Luna,在最低推理强度下就超过了最高推理强度的 GPT-5.5,而且成本只有后者的二十五分之一。最大的 GPT-5.6 Sol 则直接树立了新的标杆。
医疗是个特别吃「推理深度」和「安全边界」的场景,Luna 能用这么低的成本追上甚至超过前辈,说明模型架构和训练效率可能又上了一个台阶。但我也在想,成本降低 25 倍之后,医院和个人开发者会不会更快把 AI 诊断工具塞进日常流程?监管可能根本跟不上这个速度。
3. Claude Fable 5 11 天重写 Bun,月下载超 2200 万
Bun 最初用 Zig 一年内做出,月下载已经突破 2200 万。这次 Jarred Sumner 用预发布版 Claude Fable 5,在 11 天内把核心代码从 Zig 重写成 Rust,64 个实例并行输出超过 100 万行,API 费用约 16.5 万美元。
我个人的感受是,这件事比很多模型榜单更有冲击力。它展示的不是某个模型考了多少分,而是「一个核心基础设施可以被 AI agent 在两周内整体迁移语言栈」。当然,Rust 在内存安全上确实能帮 Bun 解决 Zig 带来的频繁内存错误,但 11 天这个数字还是太离谱了。更离谱的是,这种工作方式可能很快就会从「创始人亲自上手」变成「小团队标配」。
4. 宇树 G1 人形机器人完成首例活体微创手术
《自然》论文展示了一个相当硬核的实验,加州大学圣地亚哥团队用宇树 G1 人形机器人,对两只活猪完成了腹腔镜胆囊切除。第二次手术只花了 32 分钟。虽然论文也提到机器人还需要反复校正,目前也没法满足临床 autonomy 的要求,但这已经是「人形机器人走进手术室」的实质性一步。
长期以来,手术机器人都是专门设计的机械臂,比如达芬奇。G1 作为通用型人形机器人能完成标准微创手术,意味着硬件平台可能正在统一。如果未来一款机器人既能端茶倒水又能上台做手术,那医疗设备的成本结构会被彻底重写。
5. 蚂蚁集团发布 LingBot-VA 2.0,首个原生具身基础模型
蚂蚁集团旗下具身智能团队 Robbyant 发布了 LingBot-VA 2.0,号称首个原生具身基础模型。它采用因果 DiT 架构,视频专家约 130 亿参数,训练规模约 153 亿参数,推理时每 token 激活约 19 亿参数。
国内具身智能赛道最近很拥挤,但蚂蚁这个方案强调「原生」,意思是从模型设计之初就把视觉、动作和时序因果统一考虑,而不是把大语言模型硬套到机器人上。如果它在真实场景里的泛化能力过关,可能是国内这一批方案里最有差异化的一次尝试。
来源,MarkTechPost
6. 博科圣地被曝用 ChatGPT、Claude 等策划袭击
剑桥大学研究员对 27 名前博科圣地成员的访谈显示,该组织在 2024 年开始系统性使用 ChatGPT、Claude、Gemini、Grok、Meta AI 和 DeepSeek 等主流 AI 聊天机器人,用于袭击策划、制造更强爆炸装置和武器开发。
这不是一个遥远的恐怖主义案例,而是对 AI 安全最现实的拷问。这些模型没有地理围栏,任何人都能访问。当前的安全对齐措施在面对有明确恶意目标的使用者时,到底能拦下多少?这个问题比「模型能不能做数学题」更紧迫。
7. LinkedIn 超 40% 长文帖子由 AI 生成
安全公司 Pangram 通过 Chrome 扩展收集了超过 100 万条帖子,发现整体 AI 检测率为 13.8%,但长文(超过 250 词)中 25.72% 完全由 AI 生成。LinkedIn 的情况最严重,超过 40% 的长文帖子被标记为完全 AI 生成。
说实话,这个数据我倒不意外。LinkedIn 本来就是「职业人设表演」的集中地,AI 只是让这套表演工业化。但问题是,当平台上接近一半的深度内容都不是真人写的,读者和招聘者该怎么判断一个人的真实思考?信任稀释可能比内容泛滥更难处理。
8. Meta 关闭 Instagram 的 AI 深度伪造功能
Meta 本周上线了一个 Instagram 功能,允许用户通过 @ 提及公开账户,基于其内容生成 AI 图片,而且不需要账户所有者同意。功能推出后遭到强烈反对,Meta 迅速把它关掉了。
这件事的典型之处在于,它不是技术做不到,而是「该不该做」的边界问题。Meta 在 Muse Image 发布时显然低估了公众对肖像权和身份冒用的敏感度。对平台来说,这种「先上线再道歉」的打法,在 AI 时代会越来越贵。
来源,The Verge
9. 马斯克承认 Anthropic 是当前 AI 领导者
马斯克在 X 上发文,承认自己此前对 Anthropic 的判断有误,称 Anthropic「显然是当前 AI 领域的领导者」。他还提到,没有公司发布过像 Mythos/Fable 这样优秀的模型,并相信 Anthropic 很快会推出 Mythos 2。
这话从他嘴里说出来挺罕见的。马斯克和 Anthropic 有直接的竞争关系,xAI 的 Grok 正在追赶。但他能公开承认对手领先,说明 Anthropic 的 Claude 系列在模型质量和开发者口碑上确实形成了某种共识。不过,领先是暂时的,接下来半年模型迭代的速度可能又会洗牌。
10. 红杉提问,AI 基建要赚 3 万亿美元才能回本
红杉合伙人 David Cahn 更新了 AI 基础设施支出估算。2026 年全球投入将达 1.5 万亿美元,行业要产生 3 万亿美元收入才能回本。Anthropic 年化收入冲到 600 亿美元,OpenAI 2025 年营收预测也水涨船高。
这个数据把 AI 商业化焦虑摆到了台面上。我们现在看到了大量应用层的实验,但和 1.5 万亿的投入比起来,收入规模还差一个数量级。如果未来几年不能出现真正的高毛利、高粘性的 AI 产品,资本支出的冷却可能比想象中更快。
💡 值得关注
- Ghost Font,一种人类能读懂但 AI 无法识别的反 AI 字体,利用运动、视频、噪点和诱饵隐藏文字。来源,Hacker News
- Claude Code 桌面版新增应用内浏览器,可以直接让 Claude 阅读文档、设计稿并交互。来源,@ClaudeDevs
- 小红书 PIPO 架构,通过输入侧压缩和输出侧展开,实现长度减半、每步输出翻倍。来源,小红书技术
- 微软 Flint,面向 AI 智能体的可视化语言,让 agent 自动生成美观图表。来源,Hacker News
- Google LiteRT.js,浏览器端高性能 Web AI 推理运行时。来源,Google Developers
📝 今日思考
今天这几条新闻像是一组对照实验。Bun 被 AI 在 11 天内重写,GPT-5.6 把医疗成本压到二十五分之一,机器人和基础模型在物理世界越走越深。能力曲线确实在往上飙。
但另一边,AI 生成的内容正在把 LinkedIn 变成一座「声音相似」的鬼城,博科圣地在用公开可得的聊天机器人策划袭击,Meta 因为一张照片生成功能被骂到下线。这些不是技术失败的例子,而是技术扩散之后,社会系统还没来得及接住的例子。
我们总说 AI 是工具,但工具落到不同人手里,结果差异大到超乎预期。接下来的关键问题可能不是「模型还能多强」,而是「我们愿意为安全、真实和边界支付多少成本」。这个问题没有标准答案,但每个做产品的人每天都在用行动投票。







