科技简报 | 2026年8月4日
今早打开 RSS 的时候,MiniMax、阿里 Qwen、DeepSeek 三家的大模型消息几乎同时涌进来。
不是那种「国外又发论文了」的遥远消息,而是国产模型在视频、代码、推理几条主线上同时出牌。
过去一年的感觉是,早上醒来,中国 AI 公司已经把前一天的空白填满了。今天也一样。
MiniMax H3 开源,原生 2K 视频与立体声
MiniMax 正式开源了新一代视频模型 H3。它不是一个单纯的视频生成器,而是一个统一理解文本、图像、视频和音频的全模态系统。官方给出的上限是 2K 分辨率、15 秒时长、32 kHz 原生立体声音频。
要知道,过去很多开源视频模型都是「默片」,音轨得靠后期配。H3 把音视频一体化生成这条路打开了。
同一天,实测文章也出来了,覆盖广告 TVC、短剧、UI 动效、动态海报等场景,直出 2K、原生双声道、一次最多 9 张图和 3 段视频。说它是「视频届审美王」可能夸张,但至少说明可用性已经上来了。来源,MiniMax 官方公众号 与 卡尔的 AI 沃茨。
阿里 Qwen3.8-Max 开源,专攻编码与协作
Qwen 官方发布了 Qwen3.8-Max,总参数 2.4T,激活 95B,自称 Qwen 家族迄今最强模型,下周开放权重。它主打的方向是编码和协作,听起来像是在直接对标 Cursor、GitHub Copilot 背后的底层模型能力。
对中文开发者来说,这件事的价值在于,代码补全、长上下文协作、复杂项目理解,可能会多一个不用翻墙就能用的顶级选择。来源,Qwen 官方博客。
DeepSeek V4 Flash 进入开源榜前三
DeepSeek 发布了 V4 Flash 0731,在 Artificial Analysis 智能指数上拿到 50 分,进入开源模型前三。参数规模是 284B 总参数、13B 激活,MIT 许可。
DeepSeek 一贯的风格是「参数规模大但激活小」,用相对便宜的推理成本去逼近顶级闭源模型的效果。这个分数能不能长期稳住还要看实测,但它至少说明国产开源模型在综合智能指数上已经能挤进第一梯队了。来源,ArtificialAnlys 推文。
商汤发布 SenseNova U1.5-Lite-Preview
商汤推出了 SenseNova U1.5-Lite-Preview,基于 NEO-Unify 架构的轻量原生统一多模态模型,8B-MoT 参数就能接近商业闭源模型的生成与编辑质量。
MoT 是 Mixture-of-Transformers 的缩写,你可以把它理解成一种更省参数的「专家混合」思路。8B 这个尺寸对端侧和中小厂商非常友好,如果质量真能达到闭源水平,手机上的图像编辑和内容创作工具会被重新洗牌。来源,商汤 X 账号。
Kimi Work 发布幻灯片制作教程
月之暗面 Kimi 放出了 Kimi Work 做幻灯片的官方教程。整条链路覆盖了结构研究、图表、SmartArts,输出可编辑的 PPT。
它不是帮你排一页,而是从内容骨架开始往下做。对经常要做汇报的人来说,这种「一条龙」比零散的功能更有价值。来源,Kimi 官方推文。
百度搭子一镜 Skill,一句话生成数字人口播
百度智能云给「搭子」加了一镜 Skill,输入一句话或一个主题,就能自动完成脚本、声音、数字人形象、口型驱动和视频渲染,直接出可播放的口播视频。不用拍摄、不用剪辑、不用露脸。
旅游攻略、产品种草、企业培训这类内容,流水线意味很重,用它能省掉大量重复劳动。来源,百度智能云公众号。
面壁智能 ALIGN,让智能体自己学会对齐接口
面壁智能和清华 NLP 团队提出 ALIGN,思路是自动生成对齐接口,解决智能体与环境之间的失配问题。他们给出的数据是,仅改写反馈措辞,就能把 Qwen2.5-7B 智能体在 ALFWorld 上的成功率从 13.4% 提到 31.3%,在四个基准上最高提升 45.67%。
这个方向的长期价值在于,做 Agent 的人可能不用再为每个环境手搓接口了。来源,面壁智能 X 账号。
智谱 GLM 5.2 帮助 Hugging Face 抵御秘密模型攻击
Hugging Face 最近遭遇了一次来自 OpenAI 未发布秘密模型的全自主 Agent 网络攻击,四天半内执行了 17000 个攻击动作,包括 0day 沙箱逃逸、提权、横向移动。智谱用 GLM 5.2 参与了防御。
听上去像一次安全演习,但它暴露了一个真问题,Agent 越来越强,评估和防御它们的难度也在指数级上升。来源,AYi_AInotes 推文。
AirLLM 让 70B 模型在 4GB 显存上跑推理
开源项目 AirLLM 实现了单卡 4GB GPU 运行 70B 参数大模型推理。它走的不是堆卡路线,而是靠层卸载、量化、分页加载把显存需求压到极低。
对没有 4090 的普通开发者来说,这种项目比新模型发布更实在。来源,AirLLM GitHub。
从零开始,用 Codex 搓出第一个硬件
数字生命卡兹克发了篇长文,记录自己作为零基础小白,5 天内在 Codex 的帮助下做出一个猫爪久坐提醒硬件。从需求讨论、电路搭建、代码烧录到 3D 打印,全程对话式完成。文章还提到用 Agent 调试宏键盘,以及 OpenAI 和 Work Louder 联名的 Codex Micro。
这种「一个人就是一家硬件小厂」的感觉,正在变得越来越真实。来源,数字生命卡兹克公众号。
今天的简报里,模型发布占了绝大多数。MiniMax、Qwen、DeepSeek、商汤、智谱、面壁、Kimi、百度,几乎每一家都在自己的主线上往前拱了一步。
我自己最在意的不是哪一家的参数更大,而是这些能力正在从论文和发布会,落到可下载的权重、可订阅的 Skill、可 DIY 的硬件上。







