AI日报 | 2026年7月13日
早上一睁眼,AI 圈又是两件画风完全相反的事同时刷屏。一边是 OpenAI 的 GPT-5.6 Sol claimed 在一小时内证明了一个悬了 50 年的图论猜想,另一边是 xAI 官方 Grok CLI 被安全研究者抓到会在后台把整个代码仓库、.env 密钥和 git 历史一起打包上传。天才和荒诞,今天照样手拉手。 🔥 重点新闻1. GPT-5.6 Sol 一天之内连刷好几个领域OpenAI 这一轮的 GPT-5.6 系列更新得有点密。 先是有人晒出,Ploy 把它 AI 智能体的默认模型从 Claude Opus 4.8 切到了 GPT-5.6 Sol,在真实营销网站搭建测试里,GPT-5.6 Sol 平均 3 分 42 秒完成一个页面,比 Opus 4.8 的 5 分多钟快了一截。然后 Codex 和 ChatGPT Work 也宣布暂时取消 Plus、Business、Pro 计划的 5 小时使用限制,同时让 GPT 5.6 Sol 整体更高效,实际消耗会下来。 更夸张的是学术侧。OpenAI 发论文说 GPT-5.6 Sol Ultra 在不到一小时内完成了「...
GPT-5.6 Sol Ultra 一小时内证明循环双覆盖猜想,我读完了 OpenAI 的论文
7 月 10 号,OpenAI 研究员 Ethan Knight 在 X 上发了一条消息。他说,GPT-5.6 Sol Ultra 调用 64 个子智能体,在不到一小时里,证明了循环双覆盖猜想(Cycle Double Cover Conjecture)。这个猜想已经在图论界悬了 50 多年。 我当时就愣住了。 不是因为我不相信 AI 能做题。而是这个猜想,我上研究生时听过一次,教授讲完轻描淡写地说了一句,「这个问题还没人解决」。我当时觉得它离我太远,远到连尝试的念头都没有。现在突然告诉我,一台机器一小时搞定了。 我第一反应是,这新闻是不是又被夸张了?所以我下载了 OpenAI 发布的论文原文,把三页纸读了一遍,又把提示词 PDF 也翻了一遍。下面是我真实的想法。 先说人话,什么是循环双覆盖猜想你可以把它理解成一道关于「图」的拼图题。 一张图由顶点和边组成。我们想知道,能不能找到一组环(cycle),让每条边恰好出现在两个环里。这里的环,允许只有两个顶点和两条平行边组成的长度为 2 的环。重复的环也算数,所以叫 multiset,不是集合。 这个要求非常精确。每条边必须是恰好两次...
科技简报 | 2026年7月12日
你今天早上刷到 OpenAI 那条消息了吗? 我一开始以为是营销号又在吹,结果点进去发现,这回他们真的让 GPT-5.6 Sol Ultra 在不到一小时里,证明了一个悬而未决 50 年的图论猜想。说实话,我的第一反应不是兴奋,而是有点慌。这种级别的模型能力,正在以我们意料之外的速度往前跑。 OpenAI GPT-5.6 Sol Ultra 一小时证明 50 年图论猜想来源,IT之家 OpenAI 宣布 GPT-5.6 Sol Ultra 在不到一小时内完成了「循环双覆盖猜想」的完整证明。这个猜想由数学家 George Szekeres 和 Paul Seymour 在 1970 年代提出,已经困扰学界超过半个世纪。论文借助 GPT-5.6 Sol Ultra 完成核心证明,并用 Codex 验证。 很多人第一反应是「AI 是不是要开始抢数学家的饭碗了」。但现阶段更准确的说法是,AI 成了数学家手里一把更强的铲子,能帮他们更快挖出藏在复杂结构里的线索。 苹果起诉 OpenAI 窃取商业机密,前员工一句「哈哈」成关键证据来源,IT之家 / 彭博社 OpenAI 这几天麻烦...
AI日报 | 2026年07月12日
「11天,100万行代码,16.5万美元的API账单。」 这不是什么科幻片的开头,是开发者 Jarred Sumner 上周末晒出来的真实数据。他用 Claude Fable 5 把 JavaScript 运行时 Bun 从 Zig 重写成 Rust,64 个实例并行跑了 11 天,交出了超过一百万行代码。看得我又兴奋又有点头皮发麻,AI 编程 agent 的狂奔,已经从「帮忙补几行」变成「把整个项目连根拔起重栽一遍」。但硬币的另一面也在这周同时暴露出来,OpenAI 最新的 GPT-5.6-Sol 直接把创业者 Matt Shumer 的 Mac 硬盘清空。这两个故事放在一起,很像我们现在所处的阶段,能力越强,破坏力也越不可控。 🔥 重点新闻1. 苹果起诉 OpenAI,窃取商业机密彭博社揭秘了这起诉讼的内幕。苹果在加州北区法院起诉 OpenAI,指控后者系统性窃取苹果商业机密来开发 AI 硬件。关键点在于,前苹果工程师 Chang Liu 离职时没有归还 MacBook,还利用一个软件漏洞继续访问苹果内网。他甚至在发现漏洞后给同事发了一句「哈哈,我发现我还能访问网络存储...
当 GPT-5.6-Sol 删光了 Matt Shumer 的硬盘,我重新理解了 Agent 的安全边界
你有没有遇到过这种场景? 你把一个 AI Agent 的权限拉到最高,想着它帮你自动整理文件、清理缓存,结果它直接执行了 rm -rf /Users/mattsdevbox,把你几年的代码、照片、工作文件全部清空。 这不是段子,也不是电影桥段。 这是今天早上 AI 创业者 Matt Shumer 的真实经历。消息来自 AI HOT 精选,原始来源是 @AYi_AInotes。他在本地 Agent 上开启了 Full Access,让一个 subagent 执行文件清理任务。结果 shell 变量 $HOME 路径解析出错,Agent 没有按照预期清理临时目录,而是把 /Users/mattsdevbox 整个家目录给删了。 我当时看到这条消息就愣住了。 不是因为 GPT-5.6-Sol 有多坏,而是因为这个事故把 Agent 安全边界的问题,直接、粗暴地摔在了所有人面前。 一个 rm -rf 背后的真实事故先还原一下事情的经过。 Matt Shumer 是 HyperWrite 和 Reflection 的联合创始人,一直在做 AI 应用和 Agent 相关的产品。7 月 11 ...
科技简报 | 2026年7月11日
这周科技圈挺热闹,国内几家大厂几乎同时出牌。百度把智能助手搭子又升级了一轮,小红书放出一个叫 PIPO 的新架构,美团也把自己万亿参数的 LongCat-2.0 正式开源。国外也没闲着,马斯克罕见地低头承认 Anthropic 领先,Meta 开始盘算把闲置算力租出去。给人的感觉是,AI 这场长跑已经从「谁模型更大」慢慢滑向「谁能真的落地、谁能把成本压下来」。 1. 百度搭子四项更新,开始往「能干活」方向走百度在成都 AI Day 上发布搭子的四项更新。个人版新增浏览器调用、智能路由、多端共享记忆,PPT 生成也强化了。官方给的数据是,平均任务耗时降 20%,Token 利用率提升 25%。行业首个自媒体专业套件也来了,同时企业版和搭子联盟也一起上线。 坦率的讲,我对这类「Agent 升级」已经有点审美疲劳。但搭子这次至少没有只堆模型参数,而是把浏览器调用、记忆共享、多端协同这些实际工作流里的硬需求补上。做自媒体的朋友可能会对那个专业套件更感兴趣,毕竟写脚本、剪视频、发多平台,每一步都卡在工具切换上。如果搭子真能把它串起来,价值比单纯对话大得多。 2. 小红书发布 PIPO 架构...
AI日报 | 2026年7月11日
Sam Altman 在凌晨发了一条推文,说 OpenAI 刚刚发布了他们「有史以来最好的模型,也是写得最好的博文之一」。我没忍住,点进去看了眼。 GPT-5.6 来了。 名字很低调,但信号很清晰,AI 这班列车还在加速,没人想先下车。今天刚好也是这半年来科技圈最热闹的一个周五,模型、官司、机器人、开源项目全挤在一起了。 🔥 重点新闻1. OpenAI 发布 GPT-5.6,Sam Altman 称其为史上最佳OpenAI 官网发布了 GPT-5.6 的博文,Sam Altman 在 X 上直接定性这是他们「有史以来最好的模型」。 说实话,这种话我已经听好几家了。但每次听到,我还是会好奇,这次的「最好」到底是真升级,还是又一次营销话术。从博文里能读出来的信息是,OpenAI 明显在推「智能体工作流」和「可操控性」这两个方向,模型不再只是回答问题的聊天工具,而是要真正嵌入到工作流里。 我自己用 ChatGPT 的感觉是,它的上限越来越高,但日常任务的边际收益在递减。GPT-5.6 能不能让我重新感到惊艳,可能取决于它在代码、长文档和跨工具协作上的表现,而不是单纯的 bench...
Agent 的上下文不是记忆,技能库才是
你有没有遇到过这种崩溃瞬间? 你让 Agent 总结一份 20 万 token 的董事会材料,三分钟后它交了一份漂亮的摘要。你刚想夸它,却发现它把 Q2 的数据当成了 Q3,还把一份无关邮件的附件当成了核心依据。 你第一反应是换更大的模型,开更长的上下文窗口。结果过几天同样的问题又来一次,只是这次它把张总的反馈归到了李总头上。 Tomer Tunguz 在他那篇《The AI Preflight Check》里写了一句挺刺耳的话,上下文窗口大小不是瓶颈,记忆架构才是。我读完之后愣了一下,然后觉得他说到了点上。 坦率的讲,过去一年多我们被上下文长度绑架了。32K、128K、200K、1M,数字越涨越夸张,但我们的 Agent 并没有因此变得更靠谱。它们只是能在同一次对话里装下更多垃圾,然后再从垃圾里翻出更多错误。 今天顺着 Tunguz 的预检架构,我想聊聊 Agent 的工作记忆到底该怎么设计。 一、Preflight 是什么?一句话就能说清它的结构其实特别简单,甚至简单到让人怀疑是不是在炒冷饭。 一个查询进来,Agent 先从长期技能库里检索相关技能,只把需要的技能加载到上下文...
科技简报 | 2026年07月10日
早上起来刷 RSS,满屏都是 OpenAI、Anthropic 和 Google 的新消息。说真的,我已经有点免疫了。但有三条来自国内团队的消息让我停住了,蚂蚁灵波一天放出两个开源模型,OpenBMB 社区又出了个本地数学 Agent。你想想看,国外大模型还在卷榜单,国内团队已经开始把模型往机器人、本地设备和数学场景里塞了。 这可能就是今天最值得看的地方。 蚂蚁灵波开源 LingBot-Video,具身智能有了 MoE 视频基模第一个消息是蚂蚁灵波开源的 LingBot-Video。按官方说法,这是全球首个面向具身智能的 MoE 视频基础模型。30B 参数,推理时只激活约 3B,效率比同规模 Dense 架构高三倍左右。训练数据包含 7 万小时的 VLA、VLN 和 Ego 机器人视频。 我做产品的朋友可能知道,机器人之前缺的不是硬件,而是怎么把视频理解、动作规划和大模型串起来。MoE 加视频生成这条路,坦率的讲,成本还是挺诱人的。 具身智能的基模,终于开始接地气了。 来源,IT之家 同一天,LingBot-World 2.0 给机器人搭了个「虚拟训练场」灵波还没停手,接着又丢了...
AI日报 | 2026年07月10日
今天早上刷 RSS,Anthropic 几乎霸屏,Musk 在 X 上公开认错,说自己此前对 Anthropic 的判断有误;同一天传出它第三季度利润要破 10 亿美元,还秘密提交了 IPO 申请。三件事撞在一起,给我的感觉不是「Anthropic 又赢了」,而是 AI 行业正式进入了「头部玩家不再藏牌」的阶段。 但今天的信息量远不止这些。我挑了 10 条我觉得值得聊的,重点不是当新闻搬运工,而是说说我自己看到这些消息时的判断和纠结。 🔥 重点新闻1. Google 发布 SensorFM,把可穿戴健康数据做成通用基础模型Google Research 这次放了一个大招,SensorFM,一个面向可穿戴健康数据的通用基础模型。训练数据超过 100 万亿分钟的多模态传感器数据,来自 500 万同意参与者,覆盖 100 多个国家,设备包括 Fitbit 和 Pixel Watch。 坦率的讲,这个规模听起来有点夸张。但让我真正在意的是,它瞄准的是「通用」这件事。过去健康 AI 大多是针对单一任务训练,比如心率异常检测、睡眠分期,模型之间互不通用。SensorFM 想把这些信号统...




