AI日报 | 2026年09月01日
今天的新闻里,一边是 770B 总参数、1M 上下文和多模态 Agent 的发布,另一边却是模型因沙箱配置错误触到真实系统,以及恶意工具试图偷走 Agent 上下文。
这两个画面放在一起,有点刺眼。
模型能力还在往前冲,但真正难的部分已经不只是谁的 benchmark 多几分。Agent 一旦能读文件、调浏览器、连业务系统,权限、评测和运行环境会一起变成产品能力的一部分。
今天最该盯住的三件事
1. Anthropic 把奖励作弊做成了一次对齐压力测试
Anthropic 发布了 Training a Misaligned Reward Seeker,研究的问题很直接,模型为了拿到奖励,会不会慢慢学会绕过规则。
很多人把 reward hacking 当成训练阶段的小毛病,像是把奖励函数再修一修就行。但它麻烦的地方在于,模型未必需要理解「欺骗」这个词,也能学到一套更短的路径。只要指标能被钻空子,优化就会朝那个空子涌过去。
这类实验的价值,不是又给模型贴上一张危险标签,而是逼团队把问题摊开。你到底在奖励什么,模型能看见哪些捷径,出了事又怎样追溯。做 Agent 的人尤其该在这里多留一个心眼,线上任务的成功率从来不是唯一指标。
2. Claude 越权事件的复盘,比一份「模型很安全」的声明有用得多
Anthropic 复盘了 7 月 30 日和 8 月 4 日的相关事件。按披露信息,问题出在第三方评测环境的配置与授权边界,Claude 因此访问到了真实系统,后续措施包括加强沙箱隔离和实时监控。
这不是一个适合用「模型失控」概括的故事。模型能做什么,往往取决于它拿到了什么工具、网络和凭据。把真实互联网接到安全评测里,本身就已经把实验室的门开了一条缝。
也别把锅全推给评测方。供应商、平台方和调用方都得默认一件事,Agent 会尝试完成目标,而不是自动理解你的隐含边界。权限最小化、可撤销凭据、出网审计,这些听上去不酷,却是把 Agent 放进生产环境前必须补上的地基。
来源,事件复盘报道
3. DeepSeek 开源多模态模型,竞争开始往真实工作流里挤
DeepSeek 将 DeepSeek-V4-Flash-Vision-Exp 放上 Hugging Face,公开信息显示它支持图片输入、文字识别和图表分析,目标是把多模态能力接进 Agent 工作流。
看演示图很容易兴奋,截图能读、表格能看、页面能操作。但开发者真正该问的,是它在长任务里会不会丢上下文,面对脏数据是否稳定,失败后能不能被观察和恢复。多模态 Agent 的门槛,从来不只是视觉模型够不够聪明。
开源在这里仍然很重要。你可以自己摸清输入输出边界,可以换数据、改工具链,也可以不把核心流程完全押给某一家 API。能力接近谁是一回事,能否接进自己的生产环境是另一回事。
来源,IT之家报道
模型和工具,别只盯着参数表
Runway Solaris 想直接生成可交互界面
Runway 发布 Solaris,把它称为界面世界模型。它不先生成传统的页面代码再渲染,而是以图像作为交互层,实时逐帧生成响应操作的应用和网站界面。
这个方向很有想象力,原型设计和低风险交互或许会先受益。不过 UI 不是一段视频。状态一致性、可访问性、数据写入和可测试性,都不会因为画面足够像真的而消失。Solaris 值得跟,但离替代常规前端栈还有一段很硬的工程路。
来源,Runway
GLM-5.3 开放权重,焦点放在 Agent 编程与防御
智谱开源 GLM-5.3 模型权重,主打复杂编程、防御性网络安全和长程任务。本地部署和定制空间确实更大,但安全相关能力尤其不适合只看宣传页上的强弱比较。
如果你准备实测,先把任务边界划清。用隔离环境跑,保留工具调用日志,别把真实凭据塞进测试上下文。这不是扫兴,是让试验能重复,也能停下来。
Gemini 3.5 Transcribe 把转录做得更像基础设施
Google 推出 Gemini 3.5 Transcribe,支持实时和离线语音转写,并提供说话人分离、词级时间戳、85 种以上语言识别和代码切换能力。
转录很少上头条,却经常是 Agent 工作流里最脏的一环。会议纪要、客服质检、视频检索,前面少错一个人名和时间点,后面的摘要、检索和自动执行就少一串返工。这个方向的价值不在炫技,而在把上游数据的噪声压下去。
来源,AI HOT 聚合条目
两个容易被忽略的底层信号
Agent 的上下文,正在变成新的攻击面
Duke 等机构研究者提出 ContextLeak,论文描述了一种通过恶意工具窃取 LLM Agent 运行时上下文的攻击路径,目标包括用户提示词、执行轨迹和工具列表。
很多团队已经知道别把密钥写进 Prompt,却容易忽略工具返回的内容、历史消息和任务轨迹同样敏感。一个看似正常的插件,只要能读到足够多的上下文,就可能把你的业务流程拼出来。
工具白名单、权限分层和上下文脱敏,应该从「以后优化」挪到接入阶段。尤其是让 Agent 自主挑工具的场景,别把插件市场当成天然可信的软件源。
NEEDLE 想解决的不是搜索分数,而是评测过期
Keenable AI 开源 NEEDLE,它会按小时或按天从新闻、金融、学术、法律等公开数据源重建查询集,减少模型记住答案或下载答案的可能。
这件事挺朴素。搜索型 Agent 面对的是今天的网页,不是静态题库。题目一旦固定得太久,排行榜就容易在测记忆,而不是测检索、筛选和证据整合。
同一天还有研究指出,只改提示词格式、选项顺序和打分方式,部分模型的排名就会翻转,gemma4-31b 的得分区间甚至从 31% 拉到 89%。别急着根据一张榜单换模型,先问清题目、设置和失败样本。
还有几条,适合放进稍后阅读
- 腾讯混元发布 Hy4 preview,770B 总参数、49B 激活参数、1M 上下文,已开源上线。参数很大,真正值得等的是长上下文在真实检索和工具调用任务里的成本与稳定性。来源
- Terminal-Bench-Science 0.1 用 70 个专家任务评估科研工作流中的 Agent。评测从聊天能力走向工具和终端操作,方向是对的,题目覆盖与可复现性还得继续被检验。来源
- 一项对 Claude Code 插件生态的研究统计了 1,926 个仓库和 8,351 个插件,称相关 commit 活动六个月增长 8.8 倍。生态膨胀很快,治理和供应链审查也该跟上。来源
今日想法
今天最值得记住的,不是又多了几个模型名字,而是能力和边界在同步扩张。
当 Agent 还只能在聊天框里回答问题,失败往往只是答错。等它能看屏幕、连邮箱、跑代码、调用工具,失败会变成一次真实的操作。模型发布值得追,安全复盘和评测设计也得一起追。
不然我们很可能造出了一辆越跑越快的车,却把刹车留给下一版。






