八天四款前沿模型,Apple 起诉 OpenAI,Claude Fable 5 在 CursorBench 刷到 72.9%。

2026年7月18日这天,AI圈没有周末。

🔥 重点新闻

1. 八天四款前沿模型,Kimi K3 跻身第三

过去八天,Grok 4.5、GPT-5.6、Muse Spark 1.1 和 Kimi K3 相继发布。AI Analysis Intelligence Index 得分超过 50 的实验室,从 6 月初的 2 家变成现在的更多。

坦率地讲,这个节奏已经不是产品迭代,而是模型军备竞赛。每家都在抢同一个窗口,谁能先把下一代模型塞进用户最常用的入口,谁就能拿到未来半年的流量红利。

但我也想泼点冷水。发布密度越高,用户越难感知差异。基准分涨几个点,未必能换成真实体验。对普通开发者来说,与其追新模型,不如先把现有模型的调用成本和稳定性算清楚。

来源,AIHOT / ArtificialAnlys
https://aihot.virxact.com/items/cmrp7cwpv0ay9bitoudhrgt7k

2. Apple 起诉 OpenAI,40 名前员工收到律师函

Apple 对 OpenAI 提起诉讼,指控其通过挖角获取商业机密。随后,约 40 名已加入 OpenAI 的前 Apple 员工收到律师函,被要求保存相关文件。Apple 声称已有超过 400 名前员工在 OpenAI 工作。

这个时机很有意思。Apple 刚发布以新 Siri AI 为核心的软件公测版,转身就把法律武器对准了同一个合作伙伴。诉讼背后是竞争焦虑,也是一种谈判筹码。人才流动在硅谷是常态,但苹果显然不打算把核心 AI 人才拱手让人。

我倒不认为这场官司会立刻改变行业格局,但它释放了一个信号,大厂的护城河正在从专利和生态,变成人才和算力的直接争夺。

来源,AIHOT / The Verge AI
https://aihot.virxact.com/items/cmrp97h7o0020biuxh7pzewro

来源,AIHOT / IT之家
https://aihot.virxact.com/items/cmrove64p07imbitof1v9rzwz

3. Claude Fable 5 在 CursorBench 达到 72.9%,Claude Cowork 也来了

Cursor 的模型评估负责人 Nate Schmidt 确认,Claude Fable 5 在内部基准 CursorBench 的 Max effort 模式下达到 72.9%,创下新高。Anthropic 同时宣布,Fable 5 可在 Claude Cowork 中用于长时间、多步骤的复杂异步任务。

72.9% 这个数字本身说明不了什么,但它出现在真实编程任务的基准上,而不是靠 LeetCode 刷题。Fable 5 的定位也越来越清晰,不是陪你聊天,而是替你干活。

不过它还不是默认模型,Anthropic 把默认位留给了 Sonnet 5。原因也简单,Fable 5 贵、慢、强。企业愿意为结果买单,但个人开发者可能还是得先看账单。

来源,AIHOT / Claude Blog
https://aihot.virxact.com/items/cmrp5pfjw0af6bitoudv35oqk

来源,AIHOT / Claude Blog
https://aihot.virxact.com/items/cmrnlyzl3006sbi8v0f80nbaz

4. Sora 2 的视频克隆,已经真假难辨

一年过去,Sora 2 的视频深度克隆效果被描述为,截取一帧根本无法判断真假。它能捕捉人物面部肌肉的细微运动和走路方式。

说实话,这个演示让我兴奋又不安。兴奋的是生成技术真的到了电影级;不安的是,当真假之间的边界被抹平,验证成本会转移到每一个人身上。我们已经看到假新闻和诈骗的演化速度,Sora 2 这样的能力只会把门槛压得更低。

技术能生成,不等于社会该允许它任意生成。接下来半年,围绕水印、检测和监管的博弈会比模型本身更值得看。

来源,AIHOT / gabriel1
https://aihot.virxact.com/items/cmrp6rlcn0aq5bitortofd0cp

5. OpenAI 提出「有用智能每美元」

OpenAI 提出一个新指标,Useful Intelligence per Dollar,用来衡量 AI 投资的实际回报。它看三个维度,完成的有用工作量、成功任务的实际成本、结果的可靠性。

这个指标很聪明,因为它把企业客户从参数大战里拉出来,让他们关注「我花一块钱,到底买到了多少有用的工作」。ROI 一直是企业采购 AI 的最大顾虑,OpenAI 显然想用这套话语体系重新定价。

但「有用」本身很难定义。客服一次成功回复算不算有用?代码生成后还得人工修三遍,算不算成功?这套指标要想落地,得先统一测量口径,否则只是另一套营销话术。

来源,AIHOT / OpenAI
https://aihot.virxact.com/items/cmrozfoiv08mhbitofbllzxl4

6. 月之暗面在 GTC 2026 披露 Kimi K2.5 技术路线,K3 登顶前端编码榜

杨植麟在 GTC 2026 演讲里提出用 MuonClip 优化器替代 Adam,声称数据利用效率可提升近一倍。同时还发布了 Kimi Linear 线性注意力,以及支持 300 个 Agent 的 Agent Swarm。Kimi K3 则在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 和 GPT-5.6 Sol。

月之暗面的打法越来越像一场技术组合拳,从训练优化、长上下文到多 Agent 系统,全链路都要自己做。MuonClip 如果真能替代 Adam,那影响的不只是 Kimi,而是整个训练范式。

当然,演讲和论文之间的距离,还需要社区复现来验证。我挺期待看到后续训练细节和开源对比。

来源,AIHOT / dotey
https://aihot.virxact.com/items/cmrp8wsr10bhobitotnd5hzeq

来源,AIHOT / AYi_AInotes
https://aihot.virxact.com/items/cmroipdr803rvbito8t018vr1

欧盟依据《数字市场法案》裁定,Google 必须向竞争对手开放 Android 和 Google Search 的关键部分,包括允许第三方 AI 助手和搜索引擎获得更大访问权限。

这件事直接影响 Gemini 等 AI 服务的预装和分发。Google 在搜索和移动端的垄断地位,是 Gemini 快速获客的重要管道。如果管道被打开,其他 AI 助手就能以更低成本触达用户。

不过执行层面注定会拖很久。Google 会上诉、会谈判、会用技术接口的复杂性拖时间。对创业公司来说,这是一个窗口,但窗口期能有多长,没人知道。

来源,AIHOT / The Verge AI
https://aihot.virxact.com/items/cmrngw19f00fcbiu5iso650ol

8. 世界人工智能合作组织协定在上海签署,总部设在中国

7月16日,成立世界人工智能合作组织协定签署仪式在上海举行。29 个国家代表签署,总部设在上海,目标是促进人工智能国际合作与全球治理。

这说明全球 AI 治理正在分裂成多个中心。美国、欧盟、中国各自都在构建自己的规则框架。对企业来说,出海成本里又多了一块合规拼图。未来同一家公司的 AI 产品,可能在不同市场面临不同的训练数据、审核标准和出口管制要求。

来源,AIHOT / IT之家
https://aihot.virxact.com/items/cmrnmdjt80051bizz895rbmu6

9. 通义 Wan-Streamer v0.2 把端到端延迟压到 550ms

通义实验室发布 Wan-Streamer v0.2,把听、看、说、演统一进单个 Transformer,端到端响应延迟只要 550ms。输出分辨率从 v0.1 的 192×336 提升到 640×368。

550ms 这个数字很关键。它意味着数字人可以接近实时对话,直播客服、虚拟导游、在线教育这些场景都能用起来了。多模态模型正在从「能跑」走向「能用」。

来源,AIHOT / 通义实验室
https://aihot.virxact.com/items/cmrolz26304oqbito42v7oeaz

10. 54% 企业已遭遇 AI 智能体安全事件,一半部署后出过客户故障

VentureBeat 调查显示,107 家企业里 54% 已遭遇 AI 智能体安全事件,仅 32% 为每个智能体分配独立身份凭证。另一项对 157 家企业的调查发现,50% 的组织过去一年部署过通过内部测试、却导致客户故障的 AI 智能体。

这两组数据放在一起,说明现实对齐缺口已经很大。评估集和真实环境不是一回事,内部测试通过不代表上线不翻车。安全不是后加的配置,而是应该从设计阶段就考虑。

来源,AIHOT / VentureBeat
https://aihot.virxact.com/items/cmrnvme99015abixymkemy6lj

来源,AIHOT / VentureBeat
https://aihot.virxact.com/items/cmrnrc11901tnbizz2dlcio3z

💡 值得关注

📝 今日思考

今天的新闻拼在一起,像是一场能力狂奔和现实焦虑的拔河。一边是新模型、新指标、新纪录层出不穷;另一边是诉讼、监管、安全事件和治理分裂。

我自己的感受是,AI 技术正在进入「高能力密度」阶段。单个模型的突破还在发生,但更让人心跳加速的是它如何扎进操作系统、办公软件、云服务和法律体系里。

接下来半年,真正决定胜负的可能不是谁的模型分最高,而是谁能在真实场景里跑得稳、算得清、守得住底线。模型能力只是门票,落地成熟度才是决赛圈。

祝大家周末愉快,虽然 AI 圈没有周末。