小米的 YU7 GT 在纽北跑出自动驾驶圈速纪录了。10 分 29 秒,全程无人,纽北官方为此专门新增了「自动驾驶」分类。

这个事儿挺有意思的。一家中国车企,不是在刷量产车圈速,而是在极限赛道上验证自动驾驶系统。纽北 20 多公里、170 多个弯道,对感知和决策的要求比城市道路高几个量级。小米的说法是「在极限赛道中锤炼动态模型」,这话听着有点营销味,但逻辑本身是成立的,赛道是最极端的 corner case 集合。

微信 Agent「小微」开始灰度内测

微信的 AI Agent 终于来了。

主入口在微信首页左上角,目前能做的事包括,给好友发消息和红包(需要确认)、创建日程提醒、待办、总结朋友圈,还能打通公众号和视频号的内容。

不过真正让人在意的是子入口。群聊和私聊里会出现「问小微」选项,这个入口可以读取聊天记录,还能群发消息。你想想看,小微的上下文能力会非常强,它不只是一个通用助手,它能拿到你的社交关系和对话历史。

目前还在灰度阶段,功能受限。但方向很清楚了,微信要做的是一个嵌入社交场景的 AI Agent,不是独立的聊天机器人。

美团 tabbit 国际版免费接入旗舰模型

美团悄悄上线了一个叫 tabbit 的国际版应用,直接集成了 GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash,国内模型方面有 Kimi-2.6、GLM-5.1、MiniMax-M3。

关键是免费。

用户不需要单独订阅任何模型服务,一个 app 里就能用到各家旗舰。这步棋挺聪明的,美团在国内的 AI 布局一直不算高调,但 tabbit 国际版这个操作,等于是用流量优势去抢占海外 AI 入口。国内大厂出海做 AI 产品,又多了一个玩家。

微软成了全球最大 AI 模型中间商

彭博社报道了一个挺魔幻的事情,微软现在同时在做两件事,把 ChatGPT 卖给中国企业,把 DeepSeek 模型卖给西方客户。

微软正在测试 DeepSeek-R1 和 DeepSeek-V4,计划向西方客户提供这些中国模型。这个双向转售模式,说到底是在构建一个跨中美 AI 生态的中间层。对微软来说,它不挑模型,只挑客户。谁愿意付费,它就提供服务。

坦率的讲,这种模式短期内对各方都有利,但长期来看,地缘政治风险始终悬在头上。

AlphaFold 负责人 John Jumper 转投 Anthropic

John Jumper 宣布离开 Google DeepMind,加入 Anthropic。他在 DeepMind 待了快 9 年,带队做出了 AlphaFold,拿了诺贝尔化学奖级别的成果。

这个人事变动挺有象征意义的。AI for Science 领域最顶尖的人才,选择去了一家做通用 AI 的公司。是觉得科学问题已经解决了,还是认为更大的突破需要更强的通用智能?可能两者都有。

DeepMind CEO Demis Hassabis 发了告别信,措辞很体面。但人才流失这件事,对 DeepMind 的士气影响不好说。

Figure 机器人数首超人类员工

Figure 公司宣布,他们的机器人数量第一次超过了人类员工数量。

这话听着有点科幻,但 Figure 做的是人形机器人,不是软件 bot。如果这个数字是真实的,那它可能是具身智能领域一个很重要的里程碑。当然,「机器人数量超过人类」和「机器人能替代人类工作」之间还隔着很远的距离,但趋势已经很明确了。

Cursor 审计揭开 SWE-bench 的遮羞布

Cursor 做了一件挺有勇气的事,他们审计了自家模型在 SWE-bench Pro 上的表现,发现 Opus 4.8 Max 有 63% 的成功解决方案是直接从公开来源检索修正的,不是模型自主推导的。

隔离 git 历史并限制网络后,得分从 87.1% 暴跌。

这个发现对整个 AI 编码领域都有冲击。SWE-bench 一直是衡量代码智能体能力的标杆,但如果大部分「成功」其实是检索而非推理,那我们对 AI 编码能力的评估可能需要重新校准。Cursor 愿意公开这个结果,说实话挺难得的,大部分公司会选择沉默。

OpenAI 推出 Daybreak 安全工具

OpenAI 发布了 Daybreak 系列,包括 Codex Security 和 GPT-5.5-Cyber,定位是帮助组织大规模发现、验证并修补漏洞。

安全赛道越来越热了。之前 Anthropic 做了 Claude 的安全研究,现在 OpenAI 直接出了专用安全模型。AI 安全工具从「辅助」走向「主力」,可能比大家预想的要快。


以上就是今天的科技简报。小米在纽北刷自动驾驶圈速、微信 Agent 灰度测试、Cursor 揭开 benchmark 的真实面目,每一条背后都有值得深挖的东西。明天见。