这周国内大模型有点热闹。

蚂蚁百灵开源了 Ling-3.0-flash,阿里千问一边推 Wan3.0 视频生成一边上新功能,腾讯混元把高性能算子塞进 SGLang,小红书也跑去 ICML 发了个翻译评测基准。光看标题,确实像是各家赶在 8 月开头刷一波存在感。

但稍微多看一眼,你会发现真正有意思的是另一件事,模型能力越来越接近「能用」之后,大家开始卷工程部署、安全边界,以及怎么把 Agent 真正塞进工作流。

话不多说,今天挑 9 条值得聊的。

1. 蚂蚁百灵开源 Ling-3.0-flash

来源,蚂蚁百灵

蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash。124B 总参数、5.1B 激活的 MoE 架构,提供 FP8、FP4、INT4 多个版本,支持 API、单机、高性能三种部署方式。

MoE 开源现在越来越像军备竞赛。但这款模型的亮点其实是 FP4 和 INT4 量化版本。说明蚂蚁不只是想秀参数,而是在认真考虑普通人到底能不能跑得动这个模型。

2. 阿里千问公测 Wan3.0,App 还上新功能

来源,千问APP

千问全网首发公测视频生成模型 Wan3.0,主打稳定直出 30 秒一镜到底视频,具备导演级镜头和蒙太奇叙事,同时强调角色、道具、场景的高一致性。同一天,千问 App 还上了思考研究、定时任务、办公助理、语音通话等功能,并支持 Qwen3.8-MAX。

视频生成在追 Runway 和 Seedance,App 功能在追 ChatGPT。两手都在抓,但用户真正记住的,往往是率先做出爆款 demo 的那一边。

3. 腾讯混元 HPC-Ops 集成 SGLang

来源,LMSYS Blog

腾讯混元开源算子库 HPC-Ops 已集成进 SGLang 主分支。Dynamic Attention 与 Fused MoE 在 Hy3 模型上最高把 TPOT 降低了 48.8%。

这条新闻不直接面向 C 端,但对做国产大模型推理服务的团队来说,省下的延迟就是钱。开源底层算子,比单纯发模型尺寸更有长期价值。

4. 小红书联合浙大、复旦提出 CULTURE-MT

来源,小红书技术

小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译的「文化有效性」评测基准,并首次提出自动评估模型 JUDGER,准确率 86.03%,已入选 ICML 2026。

社交翻译最难的从来不是语法,而是梗、情绪和文化符号。小红书用自家真实数据做研究,优势也正在于它每天面对的就是这些最复杂的场景。

5. 火山引擎上线 Seedance 2.5 API

来源,火山引擎

火山引擎正式上线 Seedance 2.5 API,单次视频生成时长从 15 秒提升到 30 秒,支持最高 50 个全模态素材参考。模型在指令遵循、长叙事、真人感及声画质感上做了大幅提升,能稳定保持多角色外形与场景关系。

字节把 Seedance 2.5 搬进国内 API,国内创作者不用翻出去,也能做长叙事视频。接下来要看的是,价格能不能打动中小团队。

6. 独立开发者用 VoxCPM 让 AI 学会聊天

来源,面壁智能

独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM 三段式实时对话管道。TTS 首包延迟不到 1 秒,端到端体感只要 2 到 3 秒。

独立开发者往往比官方 demo 更会上价值。这件事的意义在于,开源声音克隆加上大模型对话的门槛,已经低到一个人能搞定。

7. OpenAI 把 Astra 列为首个「关键」网络安全模型

来源,IT之家 / @OpenAI

OpenAI 因为 Astra 在智能体编程和网络安全领域取得重大突破,依据《准备框架》将其列为旗下首个网络安全风险达「关键」级别的模型,并决定延缓发布。公司已采取隔离测试环境、限制网络与工具等额外控制措施。

一方面说明模型真的变强了,另一方面也说明安全团队确实被吓到。延迟发布比硬上更务实,也更容易让监管和公众接受。

8. Google 大规模调整 AI 组织架构

来源,The Verge

Google 宣布迄今最大规模 AI 组织调整。Demis Hassabis 卸任 DeepMind 日常管理,专注 AGI 研究;CTO Koray Kavukcuoglu 接任。27 年老将 Jeff Dean 与三位顶级研究员也离开了原岗位。

这次的信号是,研究派让位,产品和工程派上位。AGI 研究需要安静环境,但公司更需要把模型变成产品。Google 的焦虑其实和所有大厂一样,研究领先,产品能不能跟上。

9. Agent Plugins 1.0.0 发布

来源,Google Developers Blog

Agent Plugins 1.0.0 是一项由谷歌、亚马逊、微软等支持的中立目录规范,将 Agent Skills 和 MCP 服务器打包为单一可移植单元。通过标准化 plugin.json 清单和固定目录布局,开发者无需为不同 Agent 平台重复适配。

MCP 的热度还在涨,现在大厂想把它标准化。这会让 Agent 生态更像传统插件市场。但谁来当裁判、谁来制定目录规则,可能是下一个争议点。


回到开头的热闹。

表面上是模型扎堆发布,其实是能力在往下沉。国内大厂在工程、开源、垂直场景上抢位置,国外巨头则在安全、组织、标准上重新排兵布阵。

下半年只会更激烈。你准备好追了没?