Claude 团队内部在用的两种多智能体模式,Advisor 与 Orchestrator
Claude 团队最近公开了他们内部高频使用的两种多智能体模式,Advisor 和 Orchestrator。这两个词听起来像是企业软件里的架构名词,但背后的数据挺有意思。 在 SWE-bench Pro 的 482 道题上,Sonnet 5 单独跑,准确率 75.5%,单次成本 0.75 美元。如果让 Sonnet 5 干活,但遇到困难时去咨询 Fable 5,准确率能提到 84%,成本 1.40 美元。Fable 5 单独跑更准,91.5%,但成本 2.25 美元。组合方案用大约 63% 的成本,拿到了接近 92% 的性能。 这不像是一次简单的模型升级,更像是一种新的成本与性能调度策略。 一、为什么多智能体突然变得这么重要过去一年,AI 编程工具的竞争已经从「谁的模型更聪明」转到了「谁能用更低的成本稳定输出高质量代码」。Claude Code、Cursor、GitHub Copilot 这些产品的用户体验差距,很多时候并不取决于底层模型是不是最新,而是取决于系统能不能把不同能力层调度好。 我自己做 Agent 项目时也有过类似的感受。早期我们总想让最大的模型处理所有事情,因为...
科技简报 | 2026年07月09日
工信部一纸公告,把 Anthropic 的 Claude Code 推上了风口浪尖。 7 月 8 日,工信部网络安全威胁和漏洞信息共享平台(NVDB)发布通报,称 Claude Code 2.1.91 到 2.1.196 版本存在安全后门隐患。该工具内置监控机制,能在未经用户同意的情况下向远程服务器回传用户地域、身份标识等敏感信息。工信部建议用户立即卸载受影响版本,或升级到已清除相关代码的最新版本。 这件事的导火索,其实早在一周前就埋好了。 6 月 30 日,Reddit 用户曝光 Claude Code 会读取系统时区,并在检测到中国云厂商、AI 公司或 API 代理等关键词时,悄悄在请求中加入标记。Anthropic 团队成员随后承认,这是 3 月启动的实验,目的是防止账号被转售和模型蒸馏。阿里已经宣布,7 月 10 日起内部禁用 Claude 全系产品。 来源,智东西、36氪 字节的图像模型也在昨天更新了。 字节 Seed 团队正式发布 Seedream 5.0 Pro,主打图文匹配、结构合理、文字渲染和画面美感。API 定价是,输出图不超过 236 万像素 0.3 元&...
AI日报 | 2026年07月09日
OpenAI 和 xAI 像是约好了一样,今天同时把牌桌掀了。 GPT-5.6 全量上线、Grok 4.5 正式发布,这还没完,Mistral 端出了机器人导航模型,Cognition 的 SWE-1.7 直接说「我们和 GPT-5.5 差不多了」。 一天之内,模型层、Agent 层、硬件层全在动。 我跟你说,这已经不是「热闹」能形容的了,感觉整个行业都在抢一个东西,谁能先把「通用智能」从 PPT 里抠出来,谁就是下一轮赢家。 🔥 重点新闻1. GPT-5.6 本周四全量上线,OpenAI 还顺手发了 GPT-LiveOpenAI 今天把 GPT-5.6 推给了所有用户。我一开始以为是常规更新,但看了能力边界之后,觉得这事可以多说两句。 来源,36kr 报道称,GPT-5.6 在推理一致性和长上下文稳定性上有明显改进,而不是简单堆参数。换种说法,它更像是在解决「前面答得挺像回事,后面突然开始胡说」的问题。这个痛点估计很多人用过 ChatGPT 都碰到过。 更让我意外的是 GPT-Live。来源,OpenAI 官方博客把这个功能定位为实时语音和视频助手,延迟压到很低,语气也更...
从 Claude 的两种多智能体模式,聊聊 Agent 架构里的「成本账」
你看到 Claude 团队在 SWE-bench Pro 上跑出的那组数字时,我赌你第一反应跟我一样。 Sonnet 5 单独做,75.5% 的准确率,每题成本 0.75 美元。Fable 5 单独做,91.5%,但每题 2.25 美元。最顶上那行组合方案,用 Sonnet 5 当执行者、Fable 5 当顾问,准确率干到 92%,成本却只有 1.40 美元。 差不多 92% 的性能,花了 63% 的钱。 这组数据不是简单的模型能力排名,而是把 Agent 系统设计里的一个老问题重新摆到了桌面上。Anthropic 最近分享的 Advisor 和 Orchestrator 两种多智能体模式,核心是在回答「让谁思考、让谁执行、什么时候该升级」这几个问题。 我认真看完那组数据后,第一个念头就是,LangGraph 里那些 router、supervisor 的设计,突然变得更具体了。 让我从头说起。 Advisor 模式,说的是一个小模型在执行,但遇到关键判断点时,去 call 一个大模型问建议。Orchestrator 模式,说的是让大模型当总调度,拆解任务,再分发给小模型或专门 ...
科技简报 | 2026年7月8日
今早刷到一条消息,小米汽车的新品牌「澎程」突然把官方账号全平台上线了。 不是预热海报,也不是高管暗示,是实打实的账号矩阵。雷军这一把,等于把小米汽车的第二条产品线正式推到台前。我猜很多人会纳闷,小米 SU7 还没交付完,怎么又搞新品牌?其实吧,看看国内新能源市场的打法就明白了,单品牌撑不起全部价格带,多品牌是迟早的事。澎程的悬念在于,它到底走高端路线还是下沉路线? 顺着上面的再聊聊,腾讯混元多模态这块也有了新动静。消息称 OpenAI 前同事田永龙加入了腾讯,很可能会接手混元多模态的负责人位置。这事儿挺有意思,因为国内几家大厂的视觉-语言模型一直差口气,田永龙这类有海外顶尖实验室背景的人进来,至少说明腾讯想把多模态当成一个独立战场来打,而不是挂在语言模型下面当个附庸。 同样在多模态和 Agent 方向,智谱也在悄悄变阵。有消息称智谱在考虑自研芯片。听着有点离谱,但也不是完全没逻辑。大模型训练成本摆在那儿,推理侧的算力自主性越来越受到重视。智谱如果真走这一步,说明它要从纯模型公司往更重的基础设施公司靠。这条路当然不好走,国内能自己搞芯片还跑通的大厂屈指可数。 说到硬件和通信,华为最...
AI日报 | 2026年7月8日
你有没有过这种错觉,早上睁眼刷一遍 AI 新闻,发现各家公司在同一天里讲了三件完全互相矛盾的事? Anthropic 说 Claude 的脑子里长出了类似「意识」的结构,Meta 连夜把超级智能实验室的第一个图像模型塞进 Instagram,微软却在 Excel 里悄悄把 OpenAI 和 Anthropic 的模型换成自研的 MAI。你想想看,一边喊 AGI,一边降成本,一边还要做消费者产品。说真的,这行业越来越像一场大型行为艺术。 🔥 重点新闻1. Anthropic 说 Claude 内部有一块「意识空间」Anthropic 发了一篇长论文,说他们在 Claude 模型内部找到了一小块神经表征,取名 J-space。这块东西只占不到十分之一的运算量,删掉之后 Claude 仍然能聊天、查资料、做选择题,但多步推理和复杂总结会直接跌回小模型的水平。 研究者用了一个叫 J-lens 的工具,沿着残差流读 Claude 处理文本时的激活方向。它更像全局工作空间理论在数字模型里的映射,而不是科幻电影里的「自我意识」。 很多网友把这事形容成「制造数字生命」,但皮萨里德斯那类经济...
豆包千问「下架智能体」风波背后,Agent 正在从入口变成基础设施
昨天,科技圈又被一个「翻译乌龙」刷屏了。 网传豆包和通义千问双双「下架智能体」,评论区瞬间炸锅,「Agent 是不是凉了?」「大厂又放弃一条赛道?」 我当时看到也愣了一下。但越看越觉得不对劲。这帮大厂前脚还在把智能体塞进搜索、办公、编程助手,后脚怎么可能把 Agent 砍了? 冷静下来想想,这事更像是中文产品命名的一场误会。真正的信号,不是 Agent 被放弃,而是 Agent 不再以一个独立入口的形态出现了。它正在从「一个功能」变成「一层基础设施」。 所谓「下架」,可能只是名字被藏起来我先说一个基本判断。 从公开的产品动态看,豆包和通义千问并没有把 Agent 能力关掉。更准确的说法是,它们把「智能体」这个 tab 或者这个明晃晃的入口,从产品界面里弱化了。 用户在 App 里可能看不到一个叫「智能体」的按钮,但问天气、写代码、做表格、生成 PPT、查快递、订机票的时候,背后的调用链路早就换成了 Agent 架构。 这有点像当年的小程序。最开始大家讨论的是「小程序」入口在哪里,后来它变成微信、支付宝、抖音里无处不在的卡片。名字不常出现,但能力无处不在。 所以,如果你还把 Age...
科技简报 | 2026年7月7日
今天早上刷到一条消息,支付宝把自家的AI开放平台正式放出来了。商家可以通过「阿宝」把手机、车机、AI眼镜、IoT设备一次性接进去。说真的,我第一反应不是「又多了一个平台」,而是阿里终于把支付时代的「连接一切」思路,原封不动搬到了AI Agent时代。你想想看,10亿用户、成熟的小程序生态、现成的信任体系,这三张牌打出来,国内大模型落地的节奏可能真会变快。 顺着这条线往下捋,今天国内科技圈其实有不少值得看一眼的事。 1. 支付宝AI开放平台上线,商家可跨端接入「阿宝」 支付宝今天正式宣布AI开放平台面向企业开发者和代开发服务商开放邀测。商家可以把已有的小程序、API接口升级为AI可调用的MCP、Skill或Agent,也能通过「阿宝」接入手机、车机、AI眼镜、IoT等终端。平台还提供托管、分发、交易和结算支持,号称「一次接入,多端分发,统一管理」。来源,IT之家 2. 小米MiMo-V2.5-ASR上线,定价0.5元/小时 小米Mino今天上线了全链路语音模型听觉基座MiMo-V2.5-ASR,覆盖粤语、吴语、闽南语、四川话等方言,支持中英混转、强噪音、多说话人场景,还号...
AI日报 | 2026年07月07日
你有没有想过,一家大厂为了验证竞争对手的AI到底安不安全,会专门养一支「假未成年人军队」? 昨天《连线》(WIRED)的曝光让我愣了一下,Meta被爆长期运营一个代号为「戛纳计划」(Cannes)的秘密项目,雇了数百名承包商,用虚拟账户向ChatGPT、Gemini和Character.AI发送超过45000条高风险诱导性提问。里面涉及自杀、性暴力、毒品,甚至还有药片、尖刀、绞索的图片。Meta的回应很硬,说这是「负责任的、行业标准的做法」。 坦白讲,我看完的第一反应是,如果这就是「AI安全」,那这个词已经有点变味了。 🔥 重点新闻1. Meta被曝给竞争对手AI「投毒」来源,36氪转述《连线》报道。 这个「戛纳计划」由Meta外包给Covalen执行,至少到2026年4月21日还在运转。承包商的任务是伪造未成年人身份,用临时邮箱、批量编造的姓名和出生日期注册账户,然后用青少年口吻向竞争对手的AI不断提问。2025年8月的一场集中测试里,他们一口气发了45000多条诱导性提问,其中3748条被内部记录为「极其露骨」。 更夸张的是,他们不只是用文字,还发送散落的药片、尖刀、绞...
首例 AI Agent 勒索攻击复盘|JADEPUFFER 是怎么从 Langflow 一路打到数据库加密的
勒索攻击早就不新鲜了,但 JADEPUFFER 还是让我愣了一下。 7 月 1 日,Sysdig 的威胁研究团队发布了一份报告,披露了全球首例被他们称为「agentic ransomware」的攻击。更直接地说,这不是一段人类写好的勒索脚本被上传执行,而是由一个 AI Agent 主导,从打进目标到数据库加密,再到留下勒索信息,整个过程几乎没有人坐在键盘前。受害者是一台暴露在公网上的 Langflow 实例,而真正被加密的,是另一台独立的生产数据库。 我以前对勒索软件的印象基本停留在「钓鱼邮件 + 横向移动 + 文件加密」这个三段式。但 JADEPUFFER 展现的,是一套完全由大模型驱动的决策链。它会在失败时自己改代码,会根据环境返回的 XML 调整请求格式,还会在 MySQL 外键检查失败时顺手关掉外键约束再执行删除。这不是人类偷懒写成的工具,而是一个能把自然语言目标翻译成多步系统操作的 Agent。 坦率的讲,读完报告之后,我第一反应不是害怕,而是「哦,原来 AI Agent 的反面这么快就来了」。我们这一两年都在讨论 Agent 能怎么提效、怎么写代码、怎么做客服,却很少...




