这周五的 AI 圈,热闹得像开学前夜的操场。

国内几家大厂几乎同时甩出新模型,海外的收购和大厂自研推理模型也来凑热闹。我看了一下 RSS 订阅,光是今天值得聊的就有十几条。挑其中最有意思的 8 条,跟你快速过一遍。

通义千问开源 Qwen3.8 系列,把多模态和长上下文一起卷了

阿里通义千问开源了 Qwen3.8 系列。最亮眼的是 Qwen3.8-27B,原生多模态稠密模型,27B 参数就全面超过了 Qwen3.7-Plus。上下文原生 262K,可以通过 YaRN 扩展到 1M tokens。

我印象最深的是这个尺寸选择。27B 不算特别大,却把多模态和长上下文这两个高成本能力塞了进来。对开发者来说,结果就是能在单卡或低成本环境里跑一个相当能打的模型。

来源,@Alibaba_Qwen。

小红书开源 dots3-note Preview,280B 参数的「轻量」模型

小红书技术团队开源了 dots3-note Preview。总参数 280B,激活参数 16B,支持 512K 上下文,还有文本、视觉、语音多模态理解,主打复杂推理和长程 Agent 任务。

说实话,280B 被叫「轻量」这件事本身就有点超现实。不过 MoE 架构下激活只有 16B,推理成本确实可控。小红书在 dots 系列上的节奏很快,前面 dots.tts 刚开源,这次又把大模型产品线补齐了一块。

来源,公众号,小红书技术。

智谱 GLM-5.3 发布,编程能力冲上开源第一

智谱发布了 GLM-5.3,和 5.2 用同一个基座,主要靠后训练 Scaling 往上顶。编程能力提升 50%,在 Terminal Bench 3.0 等基准里拿到开源第一,接近 Claude Fable 5。

这里有个挺有意思的点,模型在白帽安全测试里还涌现出了网络安全能力。具体细节没说太细,但后训练 Scaling 带来的涌现方向确实越来越不好预测了。

来源,公众号,智谱。

DeepSeek-V4-Pro 正式上线,Agent 能力大幅增强

DeepSeek-V4-Pro 正式版今天在全平台上线,模型名直接叫 deepseek-v4-pro。它的 Agent 能力提升很明显,HLE 没工具 42.7、有工具 60.0,TerminalBench 也到了 55.6。

更让我注意的是它同步登陆了硅基流动,提供 1M 上下文窗口和低、高、最大三档推理强度。对国内开发者来说,接入门槛又低了一截。

来源,DeepSeek API 更新日志 / @SiliconFlowAI。

蚂蚁百灵跑通单机 Agentic RL 后训练闭环

蚂蚁百灵团队和 ASystem 合作,在 DGX Spark 上跑通了单机 Agentic RL 后训练闭环。他们用 Ling-3.0-tiny 和 AReno,以井字棋当最小验证任务,训练 400 步后 rollout 成功率到了 95%。

这件事的意义不在井字棋本身,而在于「单机跑通」。之前 RL 后训练动不动就要集群,现在单张 DGX Spark 就能闭环,小公司和个人开发者也能玩了。

来源,公众号,蚂蚁百灵。

Cursor 被 SpaceX 正式收购

Cursor 今天被 SpaceX 正式收购,完成了从 4 月开始的流程。Cursor 博客说,合并后将获得全球最大 GPU 集群,用来训练更强、更便宜的模型。

我对这个收购心情有点复杂。一方面,Cursor 拿到算力后确实能把模型和价格都往下压;另一方面,一家航天公司控股最火的 AI 编程工具,总感觉剧本走向有点超出想象。

来源,Cursor Blog。

WorkBuddy 上线远程控制,手机能当 Agent 控制台了

WorkBuddy 更新了远程控制功能,把 PC、App 和小程序打通了。手机端可以实时同步电脑端的任务、对话、工作空间和产物,还能一台手机连多台电脑切换。

这个功能瞄准的其实是「Agent 工作的移动化」。以后真有可能人在地铁上,手机看一眼、说两句,家里的电脑就在跑复杂任务了。

来源,公众号,数字生命卡兹克。

微软发布自研推理模型 MAI-Thinking-1

微软首发自研推理模型 MAI-Thinking-1,Mustafa Suleyman 在 X 上宣布已在 Microsoft Foundry 上线。

大厂自研推理模型已经成了一种军备竞赛。OpenAI、Google、Anthropic 之外,微软也亲自下场,后面亚马逊估计也不会闲着。推理这块的供给侧会越来越卷,对应用层开发者倒是好事。

来源,@mustafasuleyman。


快速扫完这 8 条,一个感受是,国内模型发布进入「周更」节奏,国外则是「收购 + 自研」两条线并行。

下周见。