科技简报 | 2026年09月01日
一条模型消息里,同时塞进了 770B、1M、MIT License 和 24 小时直播。
今天中文科技圈的关键词很直白,模型还在变大,但真正开始分叉的是它们准备被放到哪里去。有人把多模态模型推给 Agent,有人把超长上下文当作云端入口,也有人已经拿它做一刻不停的直播间。参数并不稀奇,落点才是。
DeepSeek 把多模态 Agent 放进开源的牌桌
DeepSeek-V4-Flash-Vision-Exp 已在 Hugging Face 开源,采用 MIT License。RSS 摘要显示,这是 DeepSeek 首个多模态模型,权重、Tokenizer 和 Prompt Encoder 均对外公开,方向明确指向视觉理解与 Agent 任务。
这类模型的看点,不只是「能看图」。对开发者来说,视觉输入一旦进入 Agent 的工具链,网页、界面截图、表单和图表就不再需要先被拆成一堆脆弱的 OCR 与规则。它离可靠地操作真实系统当然还有距离,尤其是界面理解、权限控制和错误恢复仍是难题,但开放权重至少让团队可以自己测、自己改。
来源,IT之家 RSS。 原文
智谱开源 GLM-5.3,重点落在编程与防御
智谱宣布开放 GLM-5.3 模型权重,主打智能体编程、长程任务与防御性网络安全。摘要提到它支持本地运行和定制,并给出了 AA 综合智能指数 60 分的成绩。
我更在意「防御性」这个限定。安全能力很容易被包装成一张能力清单,工程上却必须有审计、沙箱和最小权限。把模型放进真实研发流程,能不能少制造一次事故,比排行榜多几分更重要。
来源,IT之家 RSS。 原文
腾讯混元把 1M 上下文和开源放在同一张牌上
腾讯混元发布 Hy4 preview,官方摘要给出的规格是 770B 总参数、49B 激活参数、1M 上下文,并已开源,同时上线腾讯云 TokenHub 与 OpenRouter。
1M 上下文很容易让人想到「把整个仓库塞进去」。实际用过的人都知道,长上下文不是自动理解。检索、任务拆分、上下文压缩和评测一个都躲不开。它更像把工作台扩大了,不是替你收拾工作台。
来源,腾讯混元公众号。 原文
MiniMax 的 24 小时 AI 直播,开始测试视频模型的生产力
MiniMax 将 H3 Max 的 768P、480P 能力接入开放平台和 MiniMax Design。摘要中提到,海外开发者已经拿它搭建 Twitch 直播与 24 小时「AI 电视台」。
这件事有点意思。视频生成从演示片段走向连续播出,考验的不再只是单帧好不好看,而是角色一致性、叙事持续性、成本和故障恢复。一个永不停播的频道,才会把这些不浪漫的问题全部逼出来。
来源,MiniMax 公众号。 原文
语音转写继续变成基础能力,Gemini 3.5 Transcribe 盯上细节
Google 发布 Gemini 3.5 Transcribe。RSS 摘要称,它提供说话人分离、词级毫秒时间戳,支持 85 种以上语言自动识别与代码切换。
转写工具真正拉开差距的地方,往往不是「能不能转」。会议纪要里谁说了什么、哪一句需要回听、中文夹英文术语会不会断裂,这些细节才决定它会不会进入日常工作流。国内做会议、客服与内容生产工具的团队,值得盯住这条线。
来源,Google AI Developers RSS。 原文
Midjourney 试水 V8.2 编辑,图像工作流还在往可控走
Midjourney 面向所有用户开放 V8.2 图像编辑模型测试,支持指令编辑、图生图、局部重绘、扩画,并可同时引用最多 4 张参考图。
生成图已经不缺,缺的是修改时别把原本正确的东西也毁掉。对设计和内容团队而言,参考图数量、局部编辑和风格约束都是更贴近日常的能力。这里没有魔法,只有一次次减少返工。
来源,Midjourney Updates RSS。 原文
今天留下的一个判断
这批消息看起来很散,开源模型、超长上下文、视频直播、转写、图像编辑各说各话。但它们都在往同一个方向挪,模型不再只负责回答问题,而是被塞进一条具体的生产流程。
模型的数字会很快过期,工作流里省下的那一步不会。
以上内容基于今日 AI HOT RSS 汇总,产品规格与开放范围以各公司后续公告为准。







