AI日报 | 2026年5月27日
一个周末过去,AI 圈炸了两颗数学炸弹。
Anthropic 的 Claude Mythos 解决了 OpenAI 提出的 Erdős 单位距离猜想,谷歌的 AlphaProof Nexus 攻克了两道悬置 56 年的数学难题。AI 在数学发现领域,正在以一种让人不太舒服的速度往前冲。
🔥 重点新闻
1. Claude Mythos 解决 OpenAI 提出的 Erdős 问题
Anthropic 工程师 Sholto Douglas 透露,Claude Mythos 在周末期间解决了 OpenAI 之前提出的 Erdős 单位距离猜想问题,给出了一个「巧妙简洁的证明」。
这件事的戏剧性在于,问题本身是 OpenAI 提出来的,结果被 Anthropic 的模型给解了。The Decoder 的报道用了「严重超前」这个词来形容 AI 在数学发现领域的进展。
坦率的讲,我看到这条消息的时候有点愣住了。不是因为 AI 能做数学,而是这个速度。上个月还在讨论 AI 辅助数学研究的可能性,这个月就已经出成果了。数学一直被认为是人类智力的最后堡垒之一,现在这个堡垒的墙壁正在以肉眼可见的速度变薄。
来源,The Decoder
2. 谷歌 AlphaProof Nexus 攻克 56 年数学难题
同一天,IT之家报道谷歌 AI 框架 AlphaProof Nexus 攻克了 2 道悬置 56 年的数学难题。具体细节还在陆续披露中,但光是「56 年」这个数字就够吓人的了。
你想想看,两道难题,一个周末,分别被两家公司的 AI 解决。这不是巧合,这是趋势。2026 年可能会被记住为「AI 数学元年」。
来源,IT之家
3. GPT-5.6 曝光,上下文窗口 150 万 tokens
多名开发者在 OpenAI Codex 的后端日志中发现了未官宣的 GPT-5.6 模型,内部代号 iris-alpha。这个模型将支持 150 万 token 的上下文窗口,比当前 GPT-5.5 的 105 万 token 提升了大约 43%。
测试显示,在输入达到 90 万 token 时仍能流畅响应。同系列还发现了 ember-alpha 和 beacon-alpha 版本。
有一件事已经很清楚了,上下文窗口的军备竞赛还远没有结束。150 万 tokens 什么概念?大概相当于 3 本《红楼梦》的字数。所以你可以把一整个代码仓库扔进去,或者把一年的聊天记录塞进去,让它一次性处理。
预计 6 月发布。到时候 Anthropic Claude、Google Gemini 和 xAI Grok 可能也会同期出新模型,6 月会很热闹。
来源,IT之家
4. MiMo 2.5 Pro 大幅降价,最高降幅 99%
小米的 MiMo-V2.5 系列 API 价格永久下调,最高降幅达到 99%,现在和 DeepSeek V4 Pro 同价。Token 套餐也同步升级,同等价格下可用 token 量增加 5-8 倍。
所有现有用户的套餐额度会全额重置。MiMo-V2.5-TTS 限时免费。
怎么说呢,大模型 API 的价格战已经打到这种程度了。99% 的降幅不是优惠,是重新定义价格。这对开发者来说是好事,但对那些还在靠 API 调用费赚钱的公司来说,压力会非常大。
5. Anthropic 公开 Claude 隔离控制的三重机制
Anthropic 发了一篇很有诚意的工程博客,详细介绍了他们如何对不同产品中的 Claude 进行隔离控制。三重机制分别针对三个风险层面,
- 沙箱、虚拟机和网络出口控制,限制智能体的运行环境
- 系统提示词和模型训练,引导模型行为
- 对 MCP 服务器和第三方插件实施细粒度权限管理
文章以 Claude Code、claude.ai 和 Claude Cowork 为例,讲了不同产品怎么设计对应的隔离架构。
我个人觉得这类文章比模型发布更有价值。模型能力大家都能吹,但安全工程的细节才是真功夫。当你的模型越来越强、能力越来越大的时候,怎么确保它不会搞出事情来,这才是真正的工程挑战。
6. OpenRouter 完成 1.13 亿美元 B 轮融资
OpenRouter 宣布完成由 CapitalG 领投的 1.13 亿美元 B 轮融资。过去 6 个月,随着 AI 从实验快速转向生产,OpenRouter 的周处理量从 5 万亿增长到 25 万亿 token。
5 倍增长,6 个月。这个数据说明了一件事,AI 调用已经不是实验室里的玩具了,它是实实在在的生产流量。OpenRouter 作为模型路由层,吃到了这波红利。
💡 值得关注
Runway Project Luxo,AI 生成视频跨越「恐怖谷」。观众开始关注故事本身而非技术瑕疵,所有作品均由单人团队制作,耗时从 3 周到 4 小时不等。当技术足够好以至于「隐形」的时候,就该轮到讲故事的人上场了。来源,Runway
面壁智能开源 MiniCPM5-1B,仅 1B 参数,在 AA-Index 榜单上超越所有 2B 参数以下的模型。INT4 量化后权重只有 0.5GB,能在手机和浏览器上跑。端侧模型的竞争越来越有意思了。来源,IT之家
Qwen3.7-Max 成为全球第二 AI 编程模型,在 Code Arena 上得分 1541,仅次于 Claude。官方说它可运行 35 小时任务、1000+ 次工具调用。阿里云在编程赛道的追赶速度比预想的快。来源,X/@alibaba_cloud
苹果据称正使用定制版 1.2T 参数 Google 模型重塑下一代 Siri,这个参数规模远大于 Gemini 3.5 Flash。简单查询会在本地设备运行,复杂任务走云端。下个月 WWDC 应该会有大动作。来源,X/@kimmonismus
📝 今日思考
今天最让我感慨的不是哪一条具体新闻,而是一种整体的感觉,AI 的能力边界正在以一种不太线性的方式扩展。
上周还在讨论 AI 能不能做数学研究,这周就已经有成果了。上周还在讨论大模型 API 的价格,这周直接降了 99%。上周还在讨论 AI 视频的恐怖谷,这周 Runway 就说我们跨过去了。
这种速度会让人产生一种错觉,好像每天都在见证历史。但说实话,真正的变化往往不是在某个戏剧性的时刻发生的,而是在你回头看的时候才发现,原来一切已经不同了。
就像今天 Anthropic 那篇隔离控制的工程博客,它讲的不是什么惊天动地的突破,而是怎么在日常工程实践中确保 AI 系统的安全运行。这种「无聊」的工作,可能比任何一次模型发布都更重要。





