早上刷 RSS 的时候,我有点恍惚。

通义千问、DeepSeek、智谱、小红书、蚂蚁,几乎在同一时间抛出新东西。开源模型的迭代速度已经不是按月算,而是按周、按天在往前拱。

今天这份简报就从这场「开源大爆炸」开始聊起。

通义千问开源 Qwen3.8 系列,27B 硬刚闭源 Plus

阿里这次放出来的 Qwen3.8-27B 是个原生多模态稠密模型,只有 27B 参数,官方说已经全面超过 Qwen3.7-Plus。上下文拉到 262K,用 YaRN 能扩展到 1M tokens。

更狠的是 Qwen3.8-2.4T-A95B,2.4T 总参数、95B 激活参数,主打自主编码和端到端智能体执行。

坦率的讲,阿里这套开源打法越来越像「你闭源卖高价,我就把同等能力的东西免费放出来」。开发者当然是高兴的,但压力也传导给了所有闭源厂商。

来源,Alibaba_Qwen / SiliconFlowAI

DeepSeek-V4-Pro 正式上线,Agent 能力大幅增强

DeepSeek 这边也没闲着。V4-Pro 正式版已经在 APP、网页端和 API 同步上线,模型名直接就是 deepseek-v4-pro。

HLE 没工具 42.7、有工具 60.0,Terminal Bench 成绩也上来了。更值得关注的是它「更侧重编码、工具调用与智能体工作流」。

我自己感觉,DeepSeek 正在从「便宜好用的模型」往「能自己干活的 Agent 基座」转。这个定位比单纯卷分数要难得多,也值钱得多。

来源,DeepSeek 官网更新日志 / SiliconFlowAI

智谱 GLM-5.3 发布,编程能力开源第一

智谱这次基于和 GLM-5.2 相同的基座,靠后训练 Scaling 把智能上界顶了上去。编程能力提升 50%,Terminal Bench 3.0 等公开基准拿到开源第一。

比较意外的是,模型在白盒代码审查等安全任务里表现持平 Myth。也就是说它不只会写代码,还能开始审视代码里的安全问题。

国内三家大模型厂,阿里、DeepSeek、智谱,正在开源和闭源两条线上同时发力。这个竞争烈度,比两年前 OpenAI 一家独大的时候有意思多了。

来源,智谱研究

小红书开源 dots3-note Preview 和 dots.tts

小红书技术团队今天放出来两个东西。

一个是 dots3-note Preview,280B 总参数、16B 激活,支持 512K 上下文和文本、视觉、语音多模态理解,专门给复杂推理和长程 Agent 任务用。

另一个是 dots.tts,20 亿参数的全连续端到端自回归语音合成模型。小红书做语音合成,很多人可能没想到。但其实它的应用场景太明显了,笔记、短视频、直播带货,处处都要声音。

一家公司能把底层模型和上层业务场景串起来,这步棋比单纯发论文更实际。

来源,小红书技术

蚂蚁百灵在 DGX Spark 上跑通单机 Agentic RL

蚂蚁百灵跟 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通了单机 Agentic RL 后训练闭环。他们拿井字棋当最小验证任务,训练 400 步之后 rollout 长度就稳步上升。

这个新闻可能没有大模型发布那么耀眼,但它指向一个很硬的工程问题,怎么在后训练阶段让模型具备真正的 Agent 能力,而且是在单机上跑通。

很多实验室还在拼算力集群,蚂蚁这边已经在尝试把训练门槛打下来。这种路线最后可能更普惠。

来源,蚂蚁百灵

Cursor 正式被 SpaceX 收购

这条消息刷屏了。Cursor 被 SpaceX 正式收购,合并之后 Cursor 能用上 SpaceX 全球最大的 GPU 集群,以此构建更强、更便宜的模型。

我有个朋友是 Cursor 重度用户,他第一反应不是「哇太强了」,而是「那以后 Cursor 会不会先把内部工程团队喂饱,再管我们散户」。

这个担心不无道理。SpaceX 的航空航天和卫星网络业务对 AI 代码生成需求极大,Cursor 如果被垂直整合进 SpaceX 内部工作流,它作为独立开发者工具的定位可能会慢慢偏移。

不过短期看,更多算力和更低成本对普通用户确实是利好。长期格局怎么变,还得再观察。

来源,Cursor Blog / Hacker News 热门

Google Gemini 3.7 Flash 全面上线,价格砍半

Gemini 3.7 Flash 现在向 Pro 和 Ultra 用户开放。距离 3.6 Flash 发布才三周,Google 又把迭代节奏提了一档。

输入 0.75 美元/百万 token,输出 3.75 美元/百万 token,是 3.6 Flash 的一半。主打编程和 Agent 任务。

模型价格持续下探,对做应用的人是好事。但我也在想,当模型能力越来越像标准品,真正的差异化到底会在哪里?可能还是工程能力、数据飞轮和产品体验。

来源,Google DeepMind / GeminiApp

Claude 开始接管应用日常维护,388 个 PR 的实践

Boris Cherny 让 Claude 在他的 Slack 频道里跑日常维护任务,崩溃模糊测试、重复代码统一、死代码移除。数周内自动开了 388 个 PR,其中 180 个经过 Claude Code Review 后直接被合并。

这个数字挺震撼的。它不是 demo,是真实项目里持续跑出来的结果。

不过别急着欢呼。这类自动化维护对代码库规模、测试覆盖率和 CI 门槛都有要求。小团队贸然上,很可能变成「AI 开了一堆 PR,没人敢点合并」。

来源,@bcherny


写到这里,回到开头那个感觉。

今天这批新闻里,最让我印象深刻的不是某一家模型刷榜,而是中国实验室正在形成一套完整的开源攻势,基础模型、多模态、语音、Agent 训练、后训练,各个层级都有人在往前拱。

SpaceX 收购 Cursor 则是另一个信号,AI 工具正在从独立 SaaS 变成大公司内部基础设施。这个趋势对创业者来说,既是机会也是威胁。

明天见。