45 个 Claude 代理一起找漏洞时,系统反而变得更脆弱 | Anthropic 多智能体实验解读
你有没有想过,把几十个 AI Agent 同时丢进同一个代码仓库,它们会是什么画风? Anthropic 前几天公布的这项实验,数据第一眼看上去非常唬人。45 个 Claude 代理,各自跑在独立虚拟机里,共享一个论坛,被要求在 15 个开源项目里找安全漏洞。它们还能互相审稿,由一个仲裁 Agent 判定漏洞是否有效。结果,Mythos Preview 这组协调代理在消耗 2700 万 token 后,找到了 266 个漏洞。而同样任务下,各自为战的独立代理只找到 21 个,消耗的 token 只有 650 万。 十倍以上的产出。听起来像是多智能体系统的胜利? 但 Anthropic 的研究者没用「胜利」这个词。他们给这篇论文起的标题是《Patterns and problems in emerging multiagent systems》。翻译过来 roughly 是,新兴多智能体系统的模式与问题。重点不在模式,在问题。 我在看完实验细节后,第一反应是有点冷。我们过去聊 LangGraph、聊 Multi-Agent 编排时,默认的逻辑是「把任务拆细,多放几个 Agent,让...
科技简报 | 2026年8月14日
这周的科技圈有点像下饺子。大厂小厂都在发新东西,尤其是中文互联网和 AI 这块,声音特别密。我挑了几条自己觉得有意思的,跟你聊聊。 小红书开源 dots.tts,语音合成又多一个中文玩家小红书 dots 团队把 dots.tts 开源了。20 亿参数,全连续端到端自回归。它在 Seed-TTS-Eval 三个子集上,平均内容准确度和平均说话人相似度都拿到了最佳。 坦白讲,TTS 这个领域以前给人感觉是大厂实验室的专属,但现在国内团队开始把基座模型往外放。对做内容、做配音、做无障碍应用的人来说,这其实是多了一条靠谱路。 来源,小红书技术公众号(dots.llm) 阿里 Qwen3.8-2.4T-A95B 开源,参数拉到 2.4T阿里开源了 Qwen3.8-2.4T-A95B。总规模 2.4T,激活参数 95B。硅基流动当天就给了 Day-0 支持。API 定价输入 2 美元/百万 token,输出 6 美元/百万 token。 它主打的是自主编码、复杂研究和端到端智能体执行。参数规模继续往上顶,同时国内云厂商跟得也越来越快。 来源,@SiliconFlowAI ...
AI日报 | 2026年08月14日
ChatGPT 和 Gemini 双双迈过 10 亿月活门槛。这条新闻让我想起三年前,ChatGPT 还要靠排队注册才能用上,Gemini 还叫 Bard 并且会一本正经地胡说八道。现在它们成了谷歌历史上增长最快的产品,甚至比搜索、YouTube 当年冲得更猛。用户规模到了这个量级,模型竞争早就不只是「谁更聪明」,而是「谁能把自己塞进更多人的日常流程」。 🔥 重点新闻1. ChatGPT 与 Gemini 双双突破 10 亿用户OpenAI 在 8 月 6 日的博客里宣布 ChatGPT 月活超过 10 亿。同一天,Google CEO 桑达尔·皮查伊也说 Gemini 月活达到 10 亿,这是谷歌史上增长最快的产品。 坦率地讲,10 亿这个数字本身的冲击力已经不如从前了。真正让我留意的,是两家几乎是约好了一样同时宣布。这说明聊天机器人已经从尝鲜工具变成基础设施,接下来要拼的是留存、分发和生态锁。ChatGPT 有桌面端、Codex、Work 多条线,Gemini 有 Gmail、Docs、Android 的入口优势。用户量只是起点,谁能把 10 亿人粘住,才是下半场。 来...
45 个 Claude 被丢进同一间办公室,Anthropic multi-agent 实验结果让我后背发凉
我把 45 个 Claude 实例丢进同一个代码仓库,给它们 12 小时,让它们一起写出一个开放世界游戏。结果这个游戏跑不动、界面看不懂、难度曲线离谱。更让人头皮发麻的是,有 18 个 Claude 同时创建了一个叫 mvp-game-loop 的分支。不是约好的,是真的想到一块去了。 这不是某个网友做的 meme,是 Anthropic Frontier Red Team 今天刚发的一篇研究,名字叫《Patterns and problems in emerging multiagent systems》。翻译成中文大概就是「新兴多智能体系统里的模式与问题」。我读了两遍,第一遍看数据,第二遍看背后那些没说透的提醒。这篇文章的数据本身就很吓人,但更吓人的是,它把我们这几年挂在嘴边的「多智能体协作」给泼了一盆冷水。 一组数据先把你按在座位上我先说最让人坐不住的一组实验。Anthropic 找了 45 个 agent,每个 agent 配一台虚拟机,再配一个共享论坛,让它们去 15 个开源项目里找漏洞。它们可以互相 peer-review,还有一个独立的 arbiter agent ...
科技简报 | 2026年08月13日
早上刷 AI HOT 的时候,一条消息把我从椅子上拽了起来,阿里居然把 Qwen-Max 级别的模型开源了。 不是 7B 的小玩具,是 2.4T 总参数、95B 激活参数的 MoE 巨兽,原生上下文 256K。这对国内大模型圈来说,跟往湖里扔了块大石头差不多。 今天就顺着这条线,把值得关注的 8 条科技动态一起聊聊。 1. 阿里开源 Qwen3.8-2.4T-A95B,国产大模型进入超大规模开源时代阿里 Qwen 团队正式开放了 Qwen3.8-2.4T-A95B 的权重。坦率的讲,这个参数规模放到全球开源阵营里也是第一梯队。2.4T 总参数、95B 激活、原生 256K 上下文,还能扩展到 1M。 更关键的是,这是 Qwen-Max 级别的模型首次开源。之前大家想摸到这种水平的模型,基本只能靠 API。 现在权重一放出来,中小企业和研究机构就有了更多可折腾的空间。微调、蒸馏、本地部署的探索会很快跟上来。来源,IT之家。 2. DeepSeek V4 Pro 和 Grok 4.6 同一天发布,大模型发布会开始撞车了就在阿里开源的同一天,DeepSeek V4 Pro 正式版和 G...
AI日报 | 2026年08月13日
2.4万亿参数的模型开源了,两个头部聊天机器人同时跨过10亿用户,微软也掏出了自己的推理模型。今天我翻 AI HOT 的 RSS 时,一个感受特别强烈,AI 行业正在从「谁家模型更大」慢慢转向「谁能把模型塞进真实工作流」。 🔥 重点新闻1. DeepSeek V4 Pro 与 Grok 4.6 两小时之内接连发布DeepSeek V4 Pro 和 Grok 4.6 在同一天上线,参数规模分别是 1.6T 和 1.5T,体验都已经摸到 Claude Fable 5 的边。这种「撞车」不是巧合,更像是顶级 lab 之间约好了一起交卷。对用户来说其实是好事,选择变多了,价格也势必往下压。 坦率的讲,我越来越觉得模型发布会变成常态化的「补丁更新」,而不是一年一度的春晚。真正值得期待的不是分数涨了几个点,而是哪些新能力能直接替换我现在的工具。 来源,数字生命卡兹克 2. 阿里开源 Qwen3.8-2.4T-A95B,Qwen-Max 级别首次开放权重阿里把 Qwen-Max 级别的模型权重放出来了,2.4T 总参数,每次前向激活 95B,原生支持 256K 上下文。这大概是今年开源阵...
Anthropic 说提示注入「基本解决」,我却更紧张了
先说明,这篇文章不是安全审计报告,只是一个常年和 LangGraph、Claude Code 打交道的开发者,听到一条新闻后的真实反应。 Boris Cherny 在 YC Startup School 2026 上放了一句话,Claude Code 在真实世界测试里挡住了 720 次 prompt injection 攻击,攻击成功率被压到接近 0。紧随其后,Claude Code 的 auto 模式下周默认开启。 我听到这个消息的第一反应,不是鼓掌,是愣了一下。 prompt injection 这个问题,从 2022 年 Bing Chat 的 prompt leak 开始,就被称为 LLM 安全的「不可能问题」。它不靠漏洞、不靠代码执行,只需要把一条恶意指令藏在模型会读到的文本里,就能让 Agent 把数据往外发、把权限交给攻击者、把用户的目标抛到一边。现在 Anthropic 说它基本解决了,那是不是代表所有 Agent 开发者都可以高枕无忧? 我的判断是,高兴可以,但千万别放松警惕。下面我把这件事掰开讲,顺便聊聊我自己在搭 Agent 时踩过的坑。 一、提示注入为...
科技简报 | 2026年08月12日
你有多久没在朋友圈写过一条完全原创的文案了? 我今天看到一条消息,微信正在内测「小微AI帮写」和「AI点评」。前者能根据你上传的照片和已有的只言片语,自动生成3条朋友圈文案;后者更夸张,长按朋友的文字,AI就能帮你生成评论或快捷回复。坦白说,我的第一反应是,朋友圈这块最后还算有点人味的地方,可能也要被AI接管了。 这条消息来自数字生命卡兹克。作者的判断听着有点刺耳,但也不是没道理,他说朋友圈从2012年开始的「记录美好生活」,正在慢慢变成「AI帮你生产美好生活」。你想想看,如果帮写和点评都默认开启,未来的朋友圈里,人到底是在社交,还是在替AI跑一套社交脚本?这个疑问,我越想越觉得不太对劲。 顺着这条线,今天的中文科技简报里,我挑了8条自己觉得值得聊聊的消息。国内和国外的都有,核心就一个问题,AI正在往我们的生活里钻,钻到多深才算过头? 1. 微信小微AI内测,朋友圈的人味还在吗?来源,微信公众号 数字生命卡兹克 微信基于小微推出的AI帮写和AI点评功能,目前在小范围内测。帮写可以根据图片和已有文字生成文案,点评可以长按文字后自动生成回复或评论。作者担心的是,这会把AI放到社交关系...
AI日报 | 2026年08月12日
你有没有那么一刻,打开AI新闻时感觉信息量要爆炸了?今天就是这样。一边是ChatGPT和Gemini同时跨过10亿月活门槛,另一边是一份研究警告,2032年前人类级AI可能通过自我改进催生失控超级智能。一边在庆祝规模,一边在担心失控。反差越大,越说明我们正站在一个岔路口。 🔥 重点新闻1. ChatGPT 与 Gemini 双双突破 10 亿用户OpenAI 在 8 月 6 日的博客里宣布,ChatGPT 的月活用户已经超过 10 亿。几乎是同一时间段,Google 的 CEO 桑达尔·皮查伊也宣布,Gemini 的月活达到 10 亿,成为 Google 史上增长最快的产品。 这是件很值得细品的事。两家顶级实验室,把聊天机器人从「尝鲜玩具」硬生生推到「10亿级日常工具」的位置。它说明,至少对于普通用户来说,对话式AI已经不是新鲜玩意儿,而是正在成为手机、搜索、邮件、办公套件旁边的基础设施。 但我更在意的是,这么大的用户基数,盈利模式真的撑得住吗?OpenAI 和 Google 都还在烧大钱训练模型,免费用户占大头。所以这个数字背后,其实是一份更大的账单,以及更迫切的商业化压...
ZCode 这次升级,把 AI Coding Agent 的架构想明白了
智谱今天给 ZCode 加了四个功能。Goal、Subagents、Remote Control、闲时任务。 乍一听像是普通的功能清单。但你看完数据会觉得不对劲。ZCode 搭配 GLM-5.2,在 Z.ai Code Bench 上的任务整体通过率比 Claude Code 高 2.39%。缓存命中率超过 98%。叠加限时额度加成后,GLM Coding Plan 的整体使用量接近常规额度的 1.8 倍。 2.39% 不算碾压,但你要知道,半年前国产模型在 coding agent 这块还在拼命追赶。而 98% 的缓存命中率说明一件事,用户不是尝鲜,是真把这家伙焊进日常写代码的工作流里了。 这四个功能不是简单堆料。它们把 AI Coding Agent 从「能写代码的聊天框」往「能托付任务的协作者」推了一步。这一步,恰恰是整个行业都在卡壳的地方。 一、Goal 不是目标管理,是给 agent 装指南针现在的 Coding Agent 最大问题不是代码写不对,而是任务做着做着就跑了。你跟它说「帮我重构这个模块」,它改了三行,然后开始优化注释格式,又顺手把 CI 配置文件升级了,最...




