AI日报 | 2026年5月12日
Anthropic 估值五天暴涨 2000 亿美元,菲尔兹奖得主被 ChatGPT 5.5 Pro 震惊到,FrontierMath 评测系统被发现三分之一题目有致命错误。 今天这几件事放在一起看,挺有意思的。 🔥 重点新闻1. Anthropic 估值五天暴涨 2000 亿美元Anthropic 的市场隐含估值在短短五天内从 1.2 万亿美元飙升至 1.4 万亿美元。从 2025 年 10 月算起,涨了 1067%。 这速度,说实话有点离谱。 但你仔细想想,这背后是 Claude 的用户量和 API 调用量在持续爆发。再加上 Anthropic 今天同时开源了金融 AI 全栈模板(10 个端到端智能体、7 个垂直行业插件、11 家金融数据商的 MCP 连接器),覆盖投研、投行、风控等核心工作流。 来源,@kimmonismus 2. 菲尔兹奖得主测试 ChatGPT 5.5 Pro,17 分钟解决数学难题Timothy Gowers(菲尔兹奖得主)测了一下 ChatGPT 5.5 Pro,AI 在 17 分钟内独立解决了一个加法数论公开难题,产出了博士论文级别的成果。整个...
Perplexity 如何设计 Agent Skills,以及我们能偷学什么
Perplexity 在 5 月 1 号发了一篇内部指南,讲他们怎么设计、迭代和维护 Agent Skills。我读完之后的第一反应是,这帮人是真的在把 Skill 当「产品」在做,不是写个 README 交差。 坦率的讲,这篇文章里很多东西我自己踩过坑,只是没他们总结得这么系统。 先聊个反直觉的点Python 之禅说 “Simple is better than complex”。Perplexity 说,写 Skill 的时候这条完全反过来了。 一个 Skill 是一个目录,不是一个文件。复杂度是特性,不是 bug。 你想想看,你让一个 Agent 去处理美国税务问题,1945 个 IRC 条款全塞一个文件里,效果比不加载 Skill 还差。但你分成三层嵌套,每层十几个选项,模型就能精准定位了。 这其实揭示了一个本质问题,写 Skill 和写代码是两种完全不同的思维模式。代码追求简洁优雅,Skill 追求的是信息密度和渐进式展开。 Skill 的三层成本模型这是我觉得整篇文章最有价值的部分。 Perplexity 把 Skill 的上下文成本分成了三层: Index 层,每个...
科技简报 | 2026年5月11日
Cerebras 的 IPO 认购倍数超过了 20 倍。 这不是什么小道消息,是 IT 之家援引的正式报道。一家做 AI 芯片的公司,准备把发行价从 115-125 美元直接拉到 150-160 美元,涨幅接近 30%。你想想看,2026 年才过去四个多月,这可能是今年全球最大的 IPO。 市场对 AI 基础设施的热情,依然滚烫。 工信部启动 AI 伦理审查先导计划坦率的讲,这条新闻比看上去重要得多。 工信部最近启动了人工智能科技伦理审查与服务先导计划,要在国家 AI 产业创新应用先导区里探索审查服务的落地路径。具体部署了四项任务,包括细化省级伦理审查制度、指导企业建伦理委员会、开展审查实践与标准研制、构建协同治理机制。 我一直觉得,AI 伦理这件事,早做比晚做好。国内现在大模型遍地开花,如果没有一套像样的伦理框架,后面出问题再补救,代价会大很多。先导区先行先试,这个思路是对的。 腾讯混元 Hy3 预览版交出成绩单腾讯混元的 Hy3 预览版在 OpenRouter 上的免费期结束了,但它交出了一份相当亮眼的成绩单,总令牌使用量第一、代码生成第一、工具调用排名第一,在所有供应商中拿...
AI日报 | 2026年5月11日
菲尔兹奖得主 Timothy Gowers 让 ChatGPT 5.5 Pro 去解数论里的开放性问题,不到一小时,模型把一个指数界限改成了多项式界限。MIT 的研究员认为核心想法「完全具有原创性」。Gowers 说了一句让人后背发凉的话,「未来数学贡献的门槛,将是证明某些事是大语言模型做不到的。」 这不是某个 demo 展示,是菲尔兹奖得主在严肃数学研究中得出的结论。AI 日报的第 674 天,我们从这里开始。 🔥 重点新闻1. ChatGPT 5.5 Pro 两小时完成「博士级」数学研究菲尔兹奖得主 Timothy Gowers 做了一个实验,让 ChatGPT 5.5 Pro 尝试解决数论中的开放性问题。结果让人意外,模型在不到一小时内,将一个问题中的指数界限改进为多项式界限。一位 MIT 研究员审阅后认为,核心想法「完全具有原创性」。 坦率的讲,这件事的冲击力不在于 AI 能做数学,而在于评判者的身份。Gowers 不是科技博主,不是 AI 公司的 PR,他是菲尔兹奖得主,数学界最顶级的荣誉获得者。当这样的人说「未来数学贡献的门槛将是证明某些事是 AI 做不到的」,...
科技简报 | 2026年5月10日
科技简报 | 2026年5月10日70亿美元,创始人自掏30亿。 这是DeepSeek最新融资的数字。说实话,当我看到这个消息的时候,第一反应不是”哇好多钱”,而是”梁文锋到底在想什么”。 500亿美元估值,个人出资占40%,同时保留90%所有权。这种操作在AI融资史上几乎没有先例。大部分创始人到了这个阶段,早就稀释得差不多了。他反其道而行,用自有资金加注,把控制权握得更紧。 回到今天的简报,这周国内AI圈的动静不小。 DeepSeek 70亿美元融资,创中国AI单轮纪录DeepSeek正在以500亿美元估值进行高达70亿美元的融资,创下中国AI领域最大单轮融资纪录。 有意思的是,创始人梁文锋个人出资30亿美元,占本轮融资的40%,同时仍保留公司90%的所有权。这家公司最初诞生于他本人的量化对冲基金内部。 这笔钱主要用来干什么?获取算力。说到底,大模型竞赛的终局还是算力军备竞赛。 来源,Twitter @rohanpaul_ai 百度发布ERNIE 5.1,预训练成本仅为对标模型6%百度刚发布了ERNIE 5.1。 基于ERNIE 5.0的预训练基础,新模型在搜索、推理、知...
AI日报 | 2026年5月10日
70亿美元,个人掏30亿,估值500亿。 这是DeepSeek今天放出的融资数字。梁文锋一个人出了这轮融资的40%,同时还握着公司90%的股份。你想想看,一个对冲基金出身的人,把AI公司做到这个体量,整个中国AI圈怕是没谁能接住这个叙事。 🔥 重点新闻1. DeepSeek 以500亿美元估值融资70亿美元DeepSeek正在进行中国AI领域有史以来最大的单轮融资,70亿美元。创始人梁文锋个人出资30亿美元,占本轮融资的40%,同时仍保留公司90%的所有权。 坦率的讲,这个数字有点离谱。一个从量化对冲基金里长出来的AI实验室,估值直接干到500亿。最关键的是,梁文锋自己掏30亿,这意味着他对公司的控制权几乎没有被稀释。对比OpenAI那堆治理风波,DeepSeek这种”创始人绝对控股”的模式反而显得简单粗暴但有效。 这笔钱主要会用来获取算力。在中国AI赛道,算力就是命脉,谁有卡谁就能训练更大的模型。 来源,@rohanpaul_ai 2. 菲尔兹奖得主,ChatGPT 5.5 Pro 两小时完成博士级数学研究菲尔兹奖得主蒂莫西·高尔斯让ChatGPT 5.5 Pro尝试解决...
科技简报 | 2026年5月9日
DeepSeek 70亿美元,这个数字一出来,整个创投圈都炸了。 500亿美元估值,创始人梁文锋个人掏出30亿,占本轮40%。更离谱的是,他同时还保留公司90%的所有权。一个从对冲基金里长出来的AI公司,现在成了中国AI领域最大的单轮融资。 坦率的讲,这笔钱大概率会花在算力上。谁能拿到更多GPU,谁就能训练更大的模型,这个游戏规则到今天还是没变。 工信部联合多部门发布了《人工智能终端智能化分级》国家标准。这个标准用「2+N」架构,把AI终端的智能水平分成了四个等级。 L1响应级、L2工具级、L3辅助级、L4协同级。 你想想看,手机、电脑、眼镜、电视、耳机,全都被纳入了这个分级体系。L4级的细则后续才会修订发布,但方向已经很明确了,国家层面在给AI终端定规矩。 阿里云搞了个Smart Studio,定位是一站式自托管AI模型平台。 听起来有点抽象,其实就是把模型测试和服务整合到一个地方。你不用再在不同平台之间来回切换了。Qwen3.6-Max、DeepSeek-v4这些SOTA模型都能直接访问,还支持多模态和图像视频生成。 国内云厂商在AI基础设施这块的投入,确实是越来越猛了。...
AI日报 | 2026年5月9日
70亿美元,一个人掏了30亿。 这是今天AI圈最大的新闻。DeepSeek这轮融资创了中国AI领域的纪录,创始人梁文锋直接从自己口袋里掏出40%的钱,同时手里还攥着公司90%的股份。你品品这个数字结构。 🔥 重点新闻1. DeepSeek融资70亿美元,梁文锋个人出资30亿DeepSeek正以500亿美元估值进行70亿美元的融资,创下中国AI领域单轮融资纪录。最让人震惊的不是总额,而是创始人梁文锋个人出资30亿美元,占本轮融资的40%。 坦率的讲,这种操作在全球科技圈都极其罕见。创始人敢把这么大比例的个人财富押进去,要么是极度自信,要么是看到了我们看不到的东西。梁文锋最初是从自己的对冲基金里孵化出DeepSeek的,这种「自己赚的钱投自己的梦」的路径,本身就很有故事性。 本轮融资将主要用于获取算力。500亿估值,意味着市场认为DeepSeek已经跻身全球AI第一梯队。 来源,X @rohanpaul_ai 2. Anthropic计划今夏融资数百亿美元,冲击万亿估值据《金融时报》报道,Anthropic计划今年夏天进行高达500亿美元的融资,融资前估值预计达9000亿美元,...
读心术成真,Anthropic 让 Claude 把自己的想法说出来了
Anthropic 昨天发了一篇 60 多页的论文,做了一件我们以为还要等很多年的事,直接把大模型的内心独白翻译成人话。不是靠猜,不是靠分析数字,是真的用自然语言告诉你「Claude 现在在想什么」。 我花了一下午读完原文,这篇论文的技术细节和实验结果比博客摘要丰富太多了。下面尽量用人话把核心内容讲清楚。 一句话总结Anthropic 训练了一个叫 NLA(Natural Language Autoencoder)的工具,它能把 Claude 内部的一串数字(激活值)翻译成一段人能读懂的文字。如果翻译得好,另一个模型应该能从这段文字还原出原始数字。训练目标就是让这个「翻译-回译」循环越来越准。 听起来简单,但效果非常炸裂。 技术架构,三个副本的故事NLA 的核心是把同一个模型复制三份, 目标模型(Target Model),就是原始的 Claude,冻住不动,只负责产生激活值。你给它一段文本,它在处理过程中会产生很多中间数字,这些数字就是它的「想法」。 激活言语化器(Activation Verbalizer, AV),这是第二个副本,被改造成能接收一组激活值,然后输出一段...
科技简报 | 2026年5月8日
今天中文科技圈的新闻密度不低。从工信部的 AI 终端国标,到苹果的 AI 耳朵,再到全国首例 AI 短剧侵权案宣判,我挑了 10 条值得聊的。 🔥 重点新闻1. AI 终端智能化分级国标正式出炉工信部等部门联合发布了《人工智能终端智能化分级》系列国家标准,采用「2+N」架构。智能化水平从低到高分为 L1 响应级、L2 工具级、L3 辅助级和 L4 协同级四个等级,首批覆盖手机、电脑、电视、眼镜、汽车座舱、音箱、耳机 7 个品类。 小米、华为、荣耀是主要起草单位。这个标准的意义在于,以后「AI 手机」不能再随便叫了,得达到对应的等级才算。对消费者来说是好事,至少有了一个可量化的参考。L4 级标准还在修订中,说明最高级别的 AI 终端标准还在等技术成熟。 来源, IT之家 2. 苹果 AI AirPods 进入 DVT 阶段苹果内置摄像头的 AirPods 已经进入设计验证测试阶段,最快今年 9 月发布。左右耳机各配一个低分辨率摄像头,用于捕捉环境视觉信息,支持新版 Siri 实现视觉问答功能。 这是苹果首款 AI 可穿戴设备,比 Vision Pro 务实得多。耳机是每天...






