AI日报 | 2026年08月13日
2.4万亿参数的模型开源了,两个头部聊天机器人同时跨过10亿用户,微软也掏出了自己的推理模型。今天我翻 AI HOT 的 RSS 时,一个感受特别强烈,AI 行业正在从「谁家模型更大」慢慢转向「谁能把模型塞进真实工作流」。
🔥 重点新闻
1. DeepSeek V4 Pro 与 Grok 4.6 两小时之内接连发布
DeepSeek V4 Pro 和 Grok 4.6 在同一天上线,参数规模分别是 1.6T 和 1.5T,体验都已经摸到 Claude Fable 5 的边。这种「撞车」不是巧合,更像是顶级 lab 之间约好了一起交卷。对用户来说其实是好事,选择变多了,价格也势必往下压。
坦率的讲,我越来越觉得模型发布会变成常态化的「补丁更新」,而不是一年一度的春晚。真正值得期待的不是分数涨了几个点,而是哪些新能力能直接替换我现在的工具。
来源,数字生命卡兹克
2. 阿里开源 Qwen3.8-2.4T-A95B,Qwen-Max 级别首次开放权重
阿里把 Qwen-Max 级别的模型权重放出来了,2.4T 总参数,每次前向激活 95B,原生支持 256K 上下文。这大概是今年开源阵营里最重的一次出手。OpenAI 和 Google 还在把顶尖模型捂在手里,阿里反而选择把旗舰开源,姿态很不一样。
不过也别急着欢呼。2.4T 的 MoE 不是谁都能跑得动的,能把 256K 上下文用出花来的场景其实也不多。开源更值钱的地方在于让社区去蒸馏、去微调,搞出一堆垂直小模型。
来源,IT之家
3. 微软发布首个自研推理模型 MAI-Thinking-1
Mustafa Suleyman 宣布 MAI-Thinking-1 已经在 Microsoft Foundry 上线。微软之前更多是把 OpenAI 的模型接进产品,这次自己从头训了一个推理模型,信号很强。这说明他们也意识到了「只靠 OpenAI 独家合作」不够安全,得有自己的牌。
我跟你说,大厂这种布局看着热闹,但最难的不是训练模型,而是把它塞进 Office、Azure、Teams 这些产品里还不让用户骂娘。
4. ChatGPT 和 Gemini 双双突破 10 亿月活
OpenAI 和 Google 在同一天宣布自家聊天机器人月活破 10 亿。Gemini 成了 Google 有史以来增长最快的产品之一。这个数字听起来震撼,但我更关心的是「活跃用户」到底怎么定义。如果只是点进去过一次就算,那含金量要打个折。
不过你想想看,一年前大家还在讨论 AI 是不是泡沫,现在两家头部产品已经摸到 10 亿用户的门槛。这个渗透率说明聊天机器人确实成了互联网基础设施,不再是极客玩具。
来源,The Verge
5. Google Research 发现大模型事实错误的真正瓶颈是「回忆」而非「知识」
Google 提出一个叫「知识画像」的框架,结论是前沿 LLM 的事实编码已经接近饱和,但回忆能力跟不上。你想想看,模型脑子里有钥匙,但经常找不到门。他们管这叫「丢钥匙」而不是「空货架」。
我自己用 GPT-4 和 Claude 时也常遇到这种「半对半错」的回答,感觉它知道,但提取不出来。如果这条结论成立,那未来提升准确性的方向会转向检索增强、长上下文激活,而不是单纯堆参数。
6. Claude in Chrome 升级为 Claude Cowork 会话
Claude 的 Chrome 侧边栏不再只是临时聊天,而是变成了可保存的 Cowork 会话,技能、连接器都能直接在浏览器里跑,任务还能在手机、桌面和网页之间切换。
这块其实挺关键的。浏览器是大多数人工作的主战场,把 Agent 能力嵌进去,比单独打开一个 App 自然得多。接下来半年我估计会看到各家都在浏览器插件上发力。
来源,Claude Blog
7. AutoGPT 用 AGENTS.md 和技能门控管理 AI 生成的 PR
AutoGPT 团队发现 AI 智能体不会主动读文档,于是把指令写进 AGENTS.md 和技能文件,放在代码目录旁边。再加上 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名,硬是把 AI 提交的 PR 管了起来。
这个案例有意思的地方在于,它承认了 AI 会犯浑。不是说把 Agent 丢进仓库就完事了,而是要像管实习生一样设流程、设门禁。这对想引入 AI 编程的团队很有参考价值。
来源,GitHub Blog
💡 值得关注
Muse Glimmer 上线 OpenRouter,Meta 开源了一个 30B 的文本+图像模型,Apache 2.0 协议,想做本地可靠智能体。小模型+多模态+本地,这条路线今年很热门。来源,OpenRouter
LTX-2.5 视频生成模型发布,在两块 GB200 上生成 10 秒 720P 视频只要 6.8 秒,还原生集成 ComfyUI。视频生成的实时化越来越近了。来源,IT之家
OpenRouter 推出实时网页搜索基准,他们把模型、搜索引擎、搜索方法和预算组合起来测,结论是模型选择比搜索引擎更重要,增加搜索轮数收益明显。做 Agent 的朋友值得看看。来源,OpenRouter
Research Gold 号称 100% 人类撰写,实则全程 AI 驱动,一个面向医学研究者的网站伪造审稿人,还盗用真实学者照片。这种打着「反 AI」旗号的 AI 造假,可能比普通 AI 内容更危险。来源,Hacker News 中文
研究人员发现可读取加密推理过程的 API 漏洞,包括 OpenAI、Anthropic、Google 在内的多家 API 被发现能泄露推理模型的「思考链」,还扫出不少密钥和密码。安全红线又被踩了一次。来源,The Decoder
📝 今日思考
今天最让我印象深刻的不是某一条模型发布,而是两个趋势撞到了一起。
一边是巨头在参数、用户数和推理能力上继续内卷,DeepSeek、阿里、微软、xAI、Google、OpenAI 你方唱罢我登场。另一边是一些更务实的变化正在发生,Claude 往浏览器里钻、AutoGPT 给 PR 设门禁、OpenRouter 用基准测试帮大家挑 Agent 配置。
我有点怀疑,接下来一年决定胜负的不再是榜单第一名是谁,而是谁能把这些大模型悄无声息地嵌进你每天都在用的流程里。毕竟,用户不会因为你分数高就买单,他们只关心能不能少干点活。
来源整理,AI HOT RSS(2026-08-13 采集)






