AI日报 | 2026年5月25日
56 年悬而未决的数学难题,被一个 AI 系统用几百美元就解决了。
Google DeepMind 的 AlphaProof Nexus 昨天搞了个大动作,自主攻克了 9 个开放多年的 Erdős 问题,还顺手证明了 44 个 OEIS 猜想。这不是刷 benchmark,是真正意义上的数学发现。
与此同时,GitHub 的代码提交量同比暴涨 14 倍,AI 编程不仅没有取代工程师,反而把需求拉到了一个新高度。
这两件事放在一起看,有点意思。
🔥 重点新闻
1. DeepMind AlphaProof Nexus 自主解决多个开放数学问题
Google DeepMind 的 AlphaProof Nexus 系统完成了几件大事,自主解决了 9 个开放的 Erdős 问题(部分问题已经悬了 56 年),证明了 44 个 OEIS 猜想,还搞定了一个 15 年的代数几何问题,并在优化理论中发现了新算法。
每个问题的成本大概几百美元。
坦率的讲,这件事的意义远超「AI 又赢了」。Erdős 问题不是那种靠暴力搜索就能搞定的题目,它们需要的是真正的数学洞察。AlphaProof Nexus 能做到这一步,说明 AI 在「创造性推理」这块已经不是纸上谈兵了。
Terry Tao 之前就说过,「我确实看到越来越多大规模批量生产的数学」。现在看来,这话正在应验。数学研究的范式可能真的要变了,从个人天才的灵光一闪,转向 AI 系统的系统性探索。
来源,Google DeepMind via @kimmonismus
2. GitHub 代码提交量同比暴涨 14 倍,AI 编程推高工程师需求
Marc Andreessen 转发了一组让人咋舌的数据,GitHub 提交量出现了 14 倍的年同比增长,而且还在加速。
他的核心观点是 AI 编程非但没有减少软件工程师的需求,反而大幅推高了需求。逻辑其实不复杂,AI 极大降低了写代码的成本,结果不是「需要的人少了」,而是「能用代码解决的问题变多了」。越来越多行业、场景、应用开始需要定制软件。
这件事你如果关注就业市场的话,值得认真想想。很多人担心 AI 会抢走程序员的工作,但数据说的是另一个故事。当写代码的边际成本趋近于零的时候,「会写代码」本身就不值钱了,值钱的是「知道该写什么代码」。
来源,@pmarca
3. Claude 即将推出 Memory Files 功能
Anthropic 宣布 Claude 将推出 Memory Files 功能,用户可以在 Memory Files 和经典记忆模式之间切换。这个功能允许 Claude 在对话中自动写下组织化的笔记,需要时读取,用户可以随时浏览和编辑。
跟简单的聊天记录不同,Memory Files 更像是一个「知识库」,Claude 会把对话中的关键信息结构化地存下来,下次聊到相关话题时自动调用。
你想想看,这会带来什么呢?如果这个功能做得好,Claude 就不再是一个「每次对话都从零开始」的工具,而是一个真正能积累上下文的助手。这对长期项目、研究、甚至个人知识管理来说,都是个大事。
来源,@berryxia
💡 值得关注
4. AI 指数增长论需要具体数据支撑
Klaviyo 的 AI 工程师 Amish Regmi(前亚马逊推理基础设施与智能体系统构建者)撰文,批判了笼统的「AI 发展是指数级」的说法。他指出,这种说法常缺乏可验证的具体数据,指数的基数是多少?翻倍时间是多少?具体指的是哪条技术曲线?
这话听着有点刺耳,但我觉得说到点子上了。行业里太多人把「指数增长」当成一个万能挡箭牌,好像加了这个词论证就成立了。Regmi 的意思是,你得拿出具体数据来。不同的技术路线(训练、推理、数据、算法)增长速率完全不同,不能一锅烩。
来源,@kimmonismus
5. GPT-5.5 Pro 的事实核查能力获认可
Ethan Mollick 试用后发现,GPT-5.5 Pro 是一个非常可靠的事实核查工具。他把整章内容扔给它,能准确找出每一个关键引用。唯一的「毛病」是太爱抠细节,经常返回「大体思路是对的,但你没有考虑到微小细节 X」这种反馈。
Marc Andreessen 对此评价「有意思」。
我自己也用过类似的场景,AI 做事实核查确实比做生成要靠谱得多。因为它不需要「创造」,只需要「比对」。这个方向如果持续进化,对学术写作、新闻报道、内容审核的影响会很大。
6. AI 安全事件频发,Google 也在「实时应对」
两件事放一起看。TechCrunch 报道称,包括 Google 在内的科技巨头都在实时应对 AI 安全挑战,这个「实时」用得很准确,因为没人有现成的方案。
更让人警醒的是,有报道称基地组织成员曾使用 ChatGPT 查询爆炸物配比,用于策划一起造成 15 人死亡的爆炸事件。当前 AI 模型的越狱问题依然严重,而开源模型在这方面更是缺乏限制。
这不是一个可以「以后再说」的问题。
来源,TechCrunch / @AISafetyMemes
7. 阶跃星辰发布 StepAudio 2.5 Realtime 端到端语音模型
阶跃星辰发布了 StepAudio 2.5 Realtime,支持完全可定制的个性化角色扮演,通过 WebSocket API 提供服务,支持中英文。在五个基准测试维度中均排名第一。
特色是「角色扮演 RLHF」和副语言理解,不只是听懂你说什么,还能理解你怎么说的。
国内语音大模型的竞争越来越白热化了。这个赛道的终局可能不是「谁的声音更像人」,而是「谁能在对话中传递更多情感和意图」。
来源,MarkTechPost
8. 英伟达将在新加坡设立具身智能研发中心
英伟达计划在新加坡设立 AI 研究实验室,聚焦具身智能领域。黄仁勋表示,AI 与现实世界的交互是下一个前沿。实验室的目标是提升 AI 模型训练效率并降低基础设施成本,推动自动化与机器人技术发展。
具身智能这个方向,英伟达显然不想只做「卖铲子的」。从 GPU 到机器人平台,他们正在把触角伸向整个 AI 物理世界的基础设施。
来源,IT之家
📝 今日思考
AlphaProof Nexus 和 GitHub 14 倍增长,这两件事其实是同一个故事的两面。
AI 正在同时改变「思考」和「执行」。在数学领域,它开始具备真正的创造性推理能力;在工程领域,它把「写代码」的成本打到了地板上。
但有一个有意思的现象,执行越便宜,判断就越值钱。代码不值钱了,知道写什么代码更值钱了。证明不难了,提出好的问题更难了。
今天 RSS 里还有一条很火的推文,讲的是「湾区正在经历人类分化最严重的时刻」,来自 Anthropic、OpenAI、xAI 等公司的约 1 万名员工实现了远超 2000 万美元的财富自由。AI 时代的红利分配,远比技术本身更值得我们关注。






