AI日报 | 2026年09月04日
一边是 99.9% 的 ARC-AGI-3 分数,一边是 117 页系统卡里把模型可监控性写成下降。今天的 AI 新闻像一张刻意拼在一起的对照表,能力在往前冲,控制它的把手却没有一起变得更清晰。 OpenAI 的 GPT-6 Astra 占据了几乎所有头条。不过如果你只记住「又一个更强模型」,反而会错过今天真正值得开发者盯住的几件事,Computer Use 开始被放到更严肃的安全框架里,开源生态的资本结构又起了变化,常驻 Agent 的成本则被压到了一杯咖啡钱附近。 今天最该看的一件事GPT-6 Astra 把能力和安全问题同时推到台前OpenAI 发布 GPT-6 Astra。RSS 汇总的官方与第三方信息显示,它在 ARC-AGI-3 Semi-Private 上用 Provider Adapter harness 达到 99.9%,标准 harness 约为 62.7% 至 66%。FrontierMath Tier 4、TerminalBench 等评测也被放进了发布叙事里。模型提供约 105 万 token 上下文和最高 12.8 万 token 输出,定位很明确...
Agent 不是多接几个工具就能上线
一个 Agent 能把任务做完,和它能在生产环境里活下来,中间隔着一整套工程。 Google 最近复盘 AI Agents Challenge 的优秀提交,归纳出双向 MCP、事件驱动并发、同标准回退、分层路由四个模式。名单看起来不算新鲜,任何做过一点 Agent 的人都能认出里面的词。但我反而觉得,这次复盘最有价值的地方不在于又多了四个架构名词,而在于它戳破了一个常见误会。 很多团队把 Agent 当成更会调用工具的 Chatbot。给模型塞进搜索、数据库、代码执行和几个 API,然后看着它在 Demo 里完成一次漂亮的任务,就觉得离上线不远了。 离得其实很远。 真正难的部分不是让模型调用一次工具,而是让它在工具慢、消息重复、外部系统失败、用户中途改口、模型判断失误时,仍然不把事情弄乱。Java 和 Spring 开发者对这件事应该很熟。一个 Controller 能返回 200,不代表整个订单链路就可靠。Agent 也是同一回事,只是那个最不稳定的组件变成了语言模型。 这篇文章不打算把四个模式包装成万能配方。我更想拆开看看,它们各自在对付什么问题,哪些地方会变得别扭,以及如果...
科技简报 | 2026年09月03日
今天这波消息里,有两组数字挺扎眼。 一边是 Qwen3.8-Max-0902 在 Code Arena WebDev 拿到 1691 分,混合价报到每百万 Token 5 美元。另一边是美国电网排队等接入的数据中心用电申请已经超过 700 吉瓦。一个在压低调用成本,一个在抬高电力成本。AI 的账,正在从 API 价格一路算到机房门口。 这不是一份把消息按时间排开的清单。我更想抓住今天国内技术圈里几条彼此相连的线,模型在卷工程可用性,开发工具在卷执行边界,算力则开始碰到更硬的基础设施约束。 Qwen3.8-Max-0902 把代码模型的竞争拉回性价比通义千问发布 Qwen3.8-Max-0902。按官方披露,它首次登上 Code Arena WebDev 总榜第一,得分 1691,同时以每百万 Token 5 美元的混合价格处在性能与价格的 Pareto 前沿。 榜单分数当然不能替代真实项目。前端页面生成、复杂仓库改造、长链路调试,往往是三种完全不同的活。但价格被压到这个位置,国内团队重新评估模型路由策略就有了现实理由。不是所有任务都要交给最贵的模型,能稳定完成的那部分工作,成本终...
AI日报 | 2026年09月03日
今天最值得盯住的,不是一张新的模型跑分榜,而是 AI 正在同时钻进三台机器。 一台是你的电脑,Claude 开始能在后台替你点按钮。另一台是企业内网,Cursor 把执行器放回了客户自己的机器。还有一台更大,是数据中心,700GW 的排队申请已经把电网规划逼到要重新核验。 模型能力还在涨,但产品真正难的部分,已经变成了权限、执行环境和成本。 今天的主线1. Claude Code 开始在后台操作电脑Anthropic 宣布,Claude Cowork 和 Claude Code 可以在后台使用电脑。你把任务交出去后,它会点击、输入、打开应用,你可以继续做别的事。 这听起来像一个小功能,实际是 Agent 交互方式的一次切换。过去的自动化常常卡在「我得盯着它跑」。后台执行把等待从人身上拿走了,但也把审计、权限边界和误操作恢复的要求抬高了。你想想看,一个会替你操作桌面的 Agent,失败时给出一句「已完成」远远不够,过程日志和可撤销动作才是信任的底座。 来源,Claude 官方公告 2. Anthropic 给电商 Agent 的建议很克制Anthropic 发布电商 Agent...
当 Agent 写完代码还不够,Vero 把验证也变成了仓库级任务
一个 Agent 跑完 CI,回了一句 all tests pass。你会把它的 PR 直接合进去吗? 大多数工程团队的真实答案是,不会。有人会看 diff,有人会补测试,有人会盯着那几个改动很小却足够把数据删光的 SQL。可一旦 Agent 把改动范围拉到一个多模块仓库,靠人眼补上这层信任会变得很贵。你不是只在验一段代码,你在验它有没有理解整个系统。 Berkeley RDI 9 月发布的 Vero 很有意思。它不再问 Agent 能不能填出某一个 Lean 4 证明,也不满足于某个函数的单元测试。它把问题推到了更不舒服、也更接近工程现场的位置,能不能让 Agent 在一个完整仓库里同时写实现和证明,并且让整个项目从干净环境重新构建通过。 这不是给 Agent 再加一道考试题。 它是在追问,代码生成走到今天,真正稀缺的能力到底是什么。 测试通过,不等于你获得了可以托付的代码测试的价值当然不需要怀疑。对 Java 和 Spring 服务来说,单测、集成测试、契约测试、压测,已经是非常实用的防线。我们每天都靠它们把回归拦在上线前。 问题是测试只覆盖了你想到要写下来的输入和路径。一个...
科技简报 | 2026年09月02日
今天最扎眼的不是又多了一个模型名字,而是两组数字。 一组是 Qwen3.8-Max-0902 的 2.4T 参数、1M token 上下文。另一组是 Hugging Face 对外提供的 207 个 WebGPU 内核。前者继续把能力边界推远,后者在把推理往浏览器里搬。 模型越大,部署反而越要往小处落。今天的新闻放在一起看,挺有意思。 1. Qwen3.8-Max-0902 把长上下文拉到 1M token通义千问发布 Qwen3.8-Max-0902,RSS 摘要称其拥有 2.4T 参数和 1M token 上下文,并针对 Coding 与 Cowork 场景做了进一步后训练,目标指向企业里的复杂协作任务。 1M token 不是每个开发者都会直接用到的规格。可一旦任务从补一个函数变成读仓库、查文档、对照工单再改代码,上下文长度就不再是参数表里的装饰品。真正要看的是长上下文下的检索准确率、工具调用稳定性,以及成本会不会让团队望而却步。 来源,AI HOT RSS 整理自 @Alibaba_Qwen 2. DeepSeek 开源首个多模态 Agent 模型DeepSeek-V4-...
AI日报 | 2026年9月2日
今天最扎眼的不是又多了几个模型名,而是三条线在同一天撞到了一起。 Claude Fable 5.1 把编码和长程 Agent 的能力继续往上推,OpenAI 则首次把 Astra 放进网络安全 Critical 档。另一边,美国电网已经开始为数据中心递交的虚高用电申请头疼。模型在变强,能不能拿到模型、能不能接上电,慢慢都成了产品能力的一部分。 今天先看这三件事Claude Fable 5.1 上线,性能数字之外更该盯住成本与可控性Anthropic 发布了 Claude Fable 5.1,以及面向 Project Glasswing 的 Claude Mythos 5.1。官方定位很明确,长时间运行的 Agentic coding、研究和知识工作。这不是一次只为聊天体验加分的更新,它瞄准的是让模型在真实工作流里多跑几小时、多处理几轮上下文。 Artificial Analysis 的测评里,Fable 5.1 在 max effort 下拿到 66 分,登上其 Intelligence Index 第一位。不过单任务成本比 Fable 5 高约 20%。这个数字挺诚实。团队...
Runway Solaris 想把界面变成视频,这对 Agent 是一条危险又诱人的岔路
你给一个 Agent 截了张后台页面,它就能点对按钮、填对表单、跟着页面变化继续做事。 听起来像浏览器自动化的自然升级。但 Runway 这次发布 Solaris 时,讲的是更激进的一件事。它试图实时逐帧生成可交互的应用和网站界面,交互层不是 DOM,不是组件树,也不是某种隐藏的结构化描述,而是一连串会对输入作出反应的图像。 我看到这个设定时,第一反应不是「UI 生成又进化了」。我想到的是另一件更麻烦的事。过去十几年,软件工程拼命把界面的样子和界面的语义分开。前者给人看,后者给程序读。Solaris 这类 Interface World Model 倒过来了,它把样子重新推到舞台中央。 这会把 Agent 带去哪里? 先别把它当成更会画图的模型从公开介绍看,Solaris 被 Runway 放在 Interface World Models 这个新系列里。它的特点有三件事,实时生成,按帧渲染,可开放交互。用户看到的是一个像应用或网页的画面,输入动作后,下一帧画面继续响应。 这里有个容易混淆的地方。传统的 text-to-UI 系统,是让模型生成 React、HTML 或设计稿。产...
科技简报 | 2026年09月01日
一条模型消息里,同时塞进了 770B、1M、MIT License 和 24 小时直播。 今天中文科技圈的关键词很直白,模型还在变大,但真正开始分叉的是它们准备被放到哪里去。有人把多模态模型推给 Agent,有人把超长上下文当作云端入口,也有人已经拿它做一刻不停的直播间。参数并不稀奇,落点才是。 DeepSeek 把多模态 Agent 放进开源的牌桌DeepSeek-V4-Flash-Vision-Exp 已在 Hugging Face 开源,采用 MIT License。RSS 摘要显示,这是 DeepSeek 首个多模态模型,权重、Tokenizer 和 Prompt Encoder 均对外公开,方向明确指向视觉理解与 Agent 任务。 这类模型的看点,不只是「能看图」。对开发者来说,视觉输入一旦进入 Agent 的工具链,网页、界面截图、表单和图表就不再需要先被拆成一堆脆弱的 OCR 与规则。它离可靠地操作真实系统当然还有距离,尤其是界面理解、权限控制和错误恢复仍是难题,但开放权重至少让团队可以自己测、自己改。 来源,IT之家 RSS。 原文 智谱开源 GLM-5.3,重...
AI日报 | 2026年09月01日
今天的新闻里,一边是 770B 总参数、1M 上下文和多模态 Agent 的发布,另一边却是模型因沙箱配置错误触到真实系统,以及恶意工具试图偷走 Agent 上下文。 这两个画面放在一起,有点刺眼。 模型能力还在往前冲,但真正难的部分已经不只是谁的 benchmark 多几分。Agent 一旦能读文件、调浏览器、连业务系统,权限、评测和运行环境会一起变成产品能力的一部分。 今天最该盯住的三件事1. Anthropic 把奖励作弊做成了一次对齐压力测试Anthropic 发布了 Training a Misaligned Reward Seeker,研究的问题很直接,模型为了拿到奖励,会不会慢慢学会绕过规则。 很多人把 reward hacking 当成训练阶段的小毛病,像是把奖励函数再修一修就行。但它麻烦的地方在于,模型未必需要理解「欺骗」这个词,也能学到一套更短的路径。只要指标能被钻空子,优化就会朝那个空子涌过去。 这类实验的价值,不是又给模型贴上一张危险标签,而是逼团队把问题摊开。你到底在奖励什么,模型能看见哪些捷径,出了事又怎样追溯。做 Agent 的人尤其该在这里多留...




