你有没有发现,这个夏天的 AI 开始变得不一样了?

不是某个模型又刷榜了,而是它开始往你真正的工作场景里钻。手机、终端、企业私有云、甚至战场指挥系统,AI 的触角一下子伸得到处都是。2026 年 6 月 30 日这一天的消息,把这种「渗透感」表现得特别清楚。

🔥 重点新闻

1. Anthropic 推出 Claude apps gateway,让企业把 Claude Code 跑在自己的云上

坦率的讲,这条新闻可能改变接下来一年企业采用 AI coding agent 的方式。

Anthropic 今天发布了一个叫 Claude apps gateway 的东西。简单说,它是一个自托管的控制平面,让企业可以在 Amazon Bedrock 和 Google Cloud 上运行 Claude Code。部署形态是一个无状态 Linux 容器,后端不需要你重新造轮子。

这事的妙处不在技术复杂度,而在「姿态」。之前企业用 Claude Code,要么走 Anthropic 自己的 API,要么通过第三方平台。现在 Anthropic 直接把控制平面交给你,让你在自己已经付费的云环境里跑。来源,Claude Blog。

你想想看,大中型企业最怕什么?不是模型不够强,是数据流出自己的基础设施。这个 gateway 等于在说,你可以享受 Claude Code 的能力,同时把数据锁在 Bedrock 或 Google Cloud 里。这对金融、医疗、政务这类客户简直是刚需。

不过我也在想,这种「自托管」会不会让企业的 IT 部门更累?毕竟多一层控制平面,就多一层运维。但反过来说,如果 Anthropic 不这么做,企业客户可能根本不敢大规模上。

2. 美团 1.6 万亿参数 MoE 模型 Owl Alpha 登上 OpenRouter 榜首

国内大模型这次是真的搞出点动静了。

美团的 LongCat Owl Alpha 成了 OpenRouter 上最流行的模型。参数规模 1.6 万亿 MoE,累计消耗 10 万亿 tokens,性能据说达到了 Gemini / Opus 4.6 的级别。更夸张的是训练数据量,35 万亿 tokens,而且完全在 5 万块国产 ASIC 上完成。

5 万块国产 ASIC 是什么概念?这说明美团不是用英伟达 GPU 堆出来的,而是走了另一条路。来源,@EMostaque 推文。

我一直在观察国产 AI 芯片的训练可行性。之前大家总觉得国产 ASIC 只能做推理,训练大模型还是离不开英伟达。Owl Alpha 如果数据属实,会把这个刻板印象撕开一道口子。当然,成本、稳定性、生态能不能持续跟上是另一回事。

3. NVIDIA 取消原版 Rubin Ultra,新款性能直接减半

英伟达也不是永远顺风。

SemiAnalysis 爆料,GTC 2026 上宣布的 4-die 原版 Rubin Ultra 因为制造执行问题被取消了。新的 Rubin Ultra 尺寸减半,实际性能大概只有原版的一半。来源,@SemiAnalysis_ 推文。

这件事提醒我,芯片行业的护城河不只是架构设计,还有制造执行力。NVIDIA 能把 H100/B200 的供应链玩转,不代表每一次工艺跃进都能按计划落地。Rubin Ultra 这一刀砍下来,可能影响的不只是 NVIDIA 自己,还有一票等着它出货的云厂商和 AI 实验室。

4. Cursor 推出 iOS 公测版,手机真的能写代码了

Cursor 今天发布 iOS 原生公测版,付费用户都能用。

功能听起来有点像科幻片,你在手机上启动一个始终在线的云端智能体,或者远程操控电脑端的智能体。支持语音输入、斜杠命令,还能选前沿模型。智能体跑起来后,锁屏界面的 Live Activities 和推送通知会实时同步进度。来源,Cursor Blog。

我自己试想过在地铁上让 AI 修一个 bug 的场景。以前觉得这事儿不靠谱,手机屏幕那么小,怎么 review 代码?但 Cursor 的思路是,手机不需要成为主战场,它只需要成为「触发器和监视器」。你发出指令,AI 在云端或你的电脑上干完活,再通知你结果。

OpenClaw 也几乎同时发布了 iOS 和 Android 原生应用,口号是「智能体装进口袋」。来源,@openclaw 推文。

这两家同一天往移动端冲,不是巧合。说明大家都意识到,下一波竞争不在桌面浏览器,而在你裤兜里的设备。

5. Claude 正式登陆 Microsoft Foundry,跑在 Azure GB300 上

微软和 Anthropic 的合作又深了一层。

从今天起,Claude 模型在 Microsoft Foundry 上正式可用,托管在 Azure 环境里,跑在 NVIDIA GB300 GPU 上。首批提供 Claude Opus 4.8 和 Claude Haiku 4.5。来源,Claude Blog。

这条新闻和第一条 Claude apps gateway 放在一起看很有意思。Anthropic 一边跟微软深度合作公有云托管,一边又给企业客户自托管的选项。两条腿走路,避免被单一云平台绑定。

我猜接下来 Google Cloud 上的 Claude 体验也会快速跟进。云厂商之间的模型军备竞赛,正在从「谁能训练出最强模型」转向「谁能提供最顺手的模型接入」。

6. Meta 发布 Brain2Qwerty v2,用脑电信号实时解码句子

这条消息让我停下来多读了两遍。

Meta 公布了 Brain2Qwerty v2,号称目前性能最高的非侵入式脑电信号解码系统。它能从原始脑信号里实时解码完整句子,而且从字符级升级到了单词和语义级。来源,@AIatMeta 推文。

非侵入式脑机接口的难点从来不是「能不能解码」,而是「解码速度和准确率能不能接近正常打字」。Brain2Qwerty v2 如果真如论文所说实现了端到端句子解码,那离帮助运动障碍患者日常沟通又近了一大步。

不过我也得承认,这种技术离消费级应用还远。现在的价值主要在医疗和研究场景。但想想十年前的语音识别是什么水平,你就不会觉得这东西只是实验室玩具了。

7. Anthropic 工程师分享提示词工程实战,评估是唯一严谨方式

Margot Van Laar 是 Anthropic 的应用 AI 工程师,她在 Code with Claude 里聊了自己做提示词工程的真实日常。来源,@berryxia 推文。

她的核心观点很反直觉,大部分时间不是从零写提示词,而是在调试和维护已经跑在生产环境的提示词。具体做法包括用 XML 标签结构化清理、移除旧的 hack、用评估驱动迭代。

这话听着有点刺耳但确实是真话。很多人把提示词工程当成「写一段魔法咒语」,实际上它更像「维护一段 legacy code」。你改一个字,可能影响整段输出的分布。没有评估,你根本不知道自己改对了还是改错了。

这个分享对我自己的启发是,与其追求一条完美的 prompt,不如先建一个稳定的评估流水线。

💡 值得关注

  • Qwen 3.6 27B。原生支持 256k 上下文,在 MacBook Max M5 上跑 llama.cpp Q8_0 量化版能到 30 tokens/s。本地开发的理想选择越来越近了。来源,Hacker News 热门。
  • Herdr。一个驻留在终端里的 AI 智能体多路复用器,让你在单一终端里管理多个智能体会话。来源,Hacker News 热门。
  • DeepSeek 开源 DSpark。在 DeepSeek-V4 上附加草稿模块,通过半自回归生成实现无损加速,生成速度提升 60% 到 85%。来源,MarkTechPost。
  • 新浪开源 VibeThinker-3B。只有 3B 参数,但在数学和编程基准上追平比自己大 200 多倍的模型。来源,The Decoder。
  • 国务院印发教育发展「十五五」规划。推进人工智能全学段教育,提升学生 AI 素养。来源,IT之家。

📝 今日思考

今天这些新闻拼在一起,我看到了一个清晰的线条,AI 正在从「能力展示」进入「基础设施渗透」阶段。

不是只有模型发布才算新闻。Claude 进企业云、Cursor 进手机、美团用国产芯片训出万亿 MoE、教育部把 AI 写进五年规划,这些都是同一个趋势的不同侧面。

说真的,这个趋势里最让人警惕的,可能不是技术本身,而是技术的应用边界。今天还有一条新闻,美军在打击伊朗时首次大规模使用 AI 选择目标,Anthropic 的 Claude 嵌入 Palantir 的 Maven Smart System,首日建议约 1000 个目标,而对一所学校的袭击导致约 120 名儿童死亡。来源,The Decoder。

技术越强大,「谁来决定用它做什么」就越重要。这句话我说过很多次,但每次看到类似新闻,还是会被震一下。

明天的 AI 日报,我们继续聊。