科技简报 | 2026年08月28日
今天最值得盯住的,不是一张又一张跑分表,而是两个数字。 一个是 500 万亿,一个是 440MB。 前者是国内日均 Token 调用量。后者是一枚端侧翻译模型压缩后的体积。它们把同一件事夹在中间,模型正在从云端算力竞赛,挤进具体产品和具体设备里。 这份简报挑了 8 条消息。重点不在谁又发布了一个模型,而在这些模型准备落到哪里。 Token 调用过了 500 万亿,竞争开始看产品吞吐IT之家援引的数据称,截至 2026 年 6 月,中国日均 Token 调用量已突破 500 万亿。这个数字本身很大,但更有意思的是报道里的后半句,竞争焦点正从模型发布频率转向 Agent 落地和生态。 模型能力的差距还在,但企业真正会被追问的,是调用量能否转成工作流。一次漂亮的演示不难,难的是让模型稳定嵌进客服、研发、办公和内容生产的每一天。 来源,IT之家 Qwen3.8-Flash 开源,125B 模型每个 Token 只激活 6B通义千问发布 Qwen3.8-Flash-Next,并把它定位为 Qwen4 架构的早期预览。公开信息显示,它是多模态 MoE 模型,总参数 125B,每个 Token...
AI日报 | 2026年08月28日
今天的新闻里,有两个数字很容易被淹没在参数和发布会里。 一个是 4 张参考图。Midjourney V8.2 开始让用户把四张图同时塞进编辑链路。另一个是 440MB,腾讯混元把端侧翻译模型压到这个体积,已经跑在哔哩哔哩直播弹幕翻译上。 前者让生成模型更听话,后者让模型离开云端。它们指向同一件事,模型竞争正在从「能不能生成」挪到「能不能被放进具体工作里」。 今天最值得盯住的四件事Midjourney V8.2 想解决的,是创作控制感Midjourney 向所有用户开放 V8.2 图像编辑模型测试。它支持指令编辑、局部重绘、扩画,也能在一次生成中引用最多四张参考图,并兼容个性化、moodboards 和 srefs。 很多图像模型已经能生成一张漂亮图,但真正让人卡住的常常是第二步。你有一张人物设定、一张产品图、一张场景氛围和一张构图参考,模型能否把它们合到同一个结果里,还不把主体改得面目全非?四图参考不保证这个问题被彻底解决,却是在往真实创作流程靠近。 生成质量只是门票,控制感才是留存。 对设计团队而言,下一轮该测的不是单张出图有多惊艳,而是连续十次修改后,角色、风格和品牌元素...
长时程 Coding Agent,真正难的不是上下文,而是交接
一个 Agent 连续干了四个小时,写了不少代码,跑过测试,还留下了几条看上去挺像样的日志。第五个小时,新会话接手。它看着半成品,猜错了前一轮的意图,又补了一层实现,最后把原本能启动的服务弄挂了。 这不是模型突然变笨了。 这是一次没有交接班的工程事故。 Anthropic 最近公开了一篇很值得开发者细看的工程文章 Effective harnesses for long-running agents。它没有宣传某个模型又能自主干几天活了,反而承认了一件更接近现实的话,哪怕是把 Opus 4.5 放进 Agent SDK 的循环里,只有一句「做一个 claude.ai 的 clone」这种高层需求,也造不出生产质量的 Web 应用。 我挺喜欢这种承认。因为今天很多 Agent 演示最容易把人带偏的地方,正是把一次漂亮的长轨迹,当成了可重复的工程能力。 模型能写代码,只是起点。一个任务跨过多个 context window 之后,谁来保存项目状态,谁来约束它别乱改验收标准,谁来在新功能之前发现旧功能已经坏了,这些问题才决定一个 Agent 是临时的代码生成器,还是能进入研发流程的协作...
科技简报 | 2026年08月27日
今天的消息看起来很杂,模型、办公软件、端侧翻译、GPU 订单都挤在一起。但把它们放到同一张桌子上,会看到一件更具体的事。 国内公司正在把模型能力往三个地方塞,办公桌、手机端,以及更便宜的 API。至于云端,那台巨大的 GPU 印钞机还在继续转。 豆包工作先把 Agent 放进了办公室飞书与豆包团队整合后的首款 Agent 产品「豆包工作」上线。它被定位为办公场景的任务代理,支持在飞书环境中调用能力完成多步骤工作。 查看报道 来源,公众号 数字生命卡兹克 这类产品最难的部分从来不是让模型写一段像样的话,而是碰到文件、权限、日程和审批时还能不把事情弄乱。办公 Agent 的竞争,接下来会落在权限边界和流程可靠性上。能少让人确认一次,又不越权,才算真省时间。 通义拿出 Qwen4 的一张预告片通义千问开源了 Qwen3.8-Flash-Next,把它称为 Qwen4 架构的早期预览。模型为多模态 MoE,125B 总参数、每个 token 激活 6B,并引入 GDN 与 QSA 等结构改动。官方称其训练成本约为 Qwen3.7-Plus 的九分之一。 查看原始信息 来源,Qwen Bl...
AI日报 | 2026年08月27日
一边是 AWS 追加 200 万颗 GPU 的长期订单,一边是浏览器里的 Claude 开始替人点按钮。今天的 AI 新闻摆在一起看,会有一种很具体的割裂感,底层基础设施还在用十亿美元和多年交期说话,产品层已经在讨论把多少控制权交给 Agent。 这两件事其实连着。 算力继续向头部云厂商集中,Agent 则开始进入真实工作流。模型能力的竞赛没有停,只是战场正从聊天框挪到浏览器、终端、企业数据和每一条可执行的操作上。 今天最值得盯住的四件事英伟达和 AWS 把供给问题摆到了台面上英伟达预计 2028 财年销售额同比增长约 70%,黄仁勋的说法更直接,实际需求高于这个数字,限制增长的是供应能力。与此同时,英伟达将在 2027 至 2028 年为 AWS 额外供应 200 万块 GPU,亚马逊此前五个月已经同意部署超过 100 万块英伟达 GPU。 这不是一份普通的大单。云厂商愿意跨两个财年锁定如此规模的设备,买的不是今天的 token,而是未来几年承接模型训练、推理和企业 Agent 工作负载的排队资格。 英伟达刚公布的财报也给这件事加了注脚,2027 财年上半年营收为 1778...
Anthropic 把 Claude Tag 放进值班表,CI/CD 故障 median 14 分钟被定位
Anthropic 把 Claude Tag 放进值班表,CI/CD 故障 median 14 分钟被定位你有没有凌晨两点被 PagerDuty 吵醒的经历? 我有过。那次是一个依赖服务的超时阈值被改错,整条链路开始熔断。人爬起来、开电脑、翻日志、找同事、回滚,前前后后折腾了四十多分钟。最后发现,真正花在定位上的时间其实不到五分钟,其余全在上下文切换和找人确认。 所以当 Anthropic 放出那组数字时,我是真的愣住了,他们把 Claude Tag 放进 CI/CD on-call 值班表,作为故障的一线响应者。事故发生后,Claude 发布首份基于证据的分析,中位时间 14 分钟。最快一次,3 分钟内就验证完修复并确认错误率回到基线。 14 分钟。不是幻觉,不是 demo,是真实跑在 Anthropic 内部 CI 管道上的 Agent。 这不是一个客服机器人很多人第一反应是,又是营销话术吧?让大模型回回工单那种? 坦率的讲,我一开始也这么想。但仔细看完 Anthropic 那篇博客,发现它跟客服机器人完全是两码事。 Claude Tag 在这里干的活,是...
科技简报 | 2026年8月19日
宇树科技今天登陆科创板,发行价 150.80 元/股,市值冲到约 610 亿元。 人形机器人第一股,真的来了。 这不是一个孤立事件。你把视线往旁边挪一点,会发现今天国内 AI 和硬科技的动静其实很大,智谱、阿里、蚂蚁都有新动作,连海外巨头的新闻里也绕不开「中国对手」这个词。我挑了 8 条值得记录的,和你快速过一遍。 宇树科技科创板上市,人形机器人赛道再进一步宇树科技宣布股票今日在科创板上市,发行价 150.80 元/股,对应市值约 609.93 亿元,预计募资约 60.99 亿元。 从 2023 年到 2025 年,它的营收从 1.59 亿元涨到 3.93 亿元,增速非常快。但坦白说,人形机器人今天更多是「估值在讲故事」,量产和实际应用还在早期。 这件事的意义不在它现在赚了多少,而在于 A 股终于有了一个人形机器人标的。 来源,IT之家 智谱 GLM-5.3 上线,开源阵营继续上分智谱今天把 GLM-5.3 API 上线了。官方说法是它擅长复杂编码、防御性网络安全和长程任务,在 AA 综合智能指数里拿了 60 分。 这个分数和 Claude Fable 5、...
AI日报 | 2026年8月19日
「22.6% 到 35.1% 的命中率,15 个靶点里成功 14 个。」 这是 Anthropic 今天公布的 Claude 蛋白质设计实验结果。坦率地讲,我看到这组数据时有点愣。不是因为数字有多高,而是因为它说明 AI 正在从「帮你写邮件」往「帮你设计分子」那个方向走。而且走得比我们想象的要快。 🔥 重点新闻1. Claude 开始设计蛋白质,14/15 个靶点命中Anthropic 在两项实验里让 Claude(Mythos Preview 和 Opus 4.8)针对 15 个蛋白质靶点设计结合剂。结果成功了 14 个,命中率在 22.6% 到 35.1% 之间。 这数字听着可能不够震撼。但你想想看,传统高通量筛选的命中率往往只有千分之一甚至更低。22.6% 已经是百倍的提升。更关键的是,Claude 不是专门的生物模型,它是在通用能力基础上被拉去干这个活儿的。这和其他「专门的生物 AI」不一样。它说明通用模型的推理能力,已经开始跨学科迁移到 wet lab 场景。 来源,Anthropic Research 2. Claude Tag 当 CI/...
45个AI智能体一起干活,找到266个漏洞,也暴露了Agent协作的暗面
我最近在复盘 Anthropic 一项关于多智能体的研究时,盯着屏幕上的一个数字愣了好几秒。 45 个协调起来的 AI 智能体,在 2700 万 token 的运行里,找出了 266 个代码漏洞。而同样的任务,如果换成各自为战、独立并行的方式,650 万 token 只找到 21 个。 266 对 21。这不是两倍三倍的差距,是整整一个数量级。 更让我意外的是,两组方法找出来的漏洞,重叠部分只有 12 个。也就是说,协调智能体发现的东西,独立智能体几乎挖不到,反过来也一样。这不像是一群 AI 在重复劳动,更像是两种完全不同的认知方式在互补。 Anthropic 把这项研究命名为「新兴多智能体系统的模式与问题」。坦率的讲,这个标题有点学术腔,但它背后指向的问题一点都不抽象。它其实在问我们一件很具体的事,当 AI 智能体不再只是人类的工具,而是开始大规模互相协作时,会发生什么? 我先说我的直观判断。这项研究让我确信,多智能体协作已经不是遥远的概念,而是正在进入「可落地」的区间。但与此同时,它带来的系统性风险,也被整个行业严重低估了。 一、协调为什么能赢这么多?要理解 266 这个数字...
科技简报 | 2026年08月18日
明天的科创板要迎来一只很特殊的股票。 宇树科技正式宣布,8月19日挂牌上市,发行价150.80元每股,市值大概610亿元。很多人把它叫做A股「人形机器人第一股」。这家公司2023年营收才1.59亿,到2025年已经冲到8.78亿,增速确实够猛。来源,IT之家 这说明什么? 资本市场开始认真给人形机器人定价了。不是概念,是订单和产能。当然这也不代表明天开盘一定稳,但该来的总归要来。 同一天,国内大模型圈也没闲着。 通义千问开源了Qwen3.8系列。其中最亮眼的是Qwen3.8-27B,只有27B参数,但官方基准说它已经超过了前代Qwen3.6-27B,甚至超过了闭源的Qwen3.7-Plus。更夸张的是Qwen3.8-2.4T-A95B,2.4万亿参数、950亿激活参数,主打自主编码和端到端智能体执行。硅基流动已经Day-0上线,输入2美元、输出6美元每百万token。来源,@Alibaba_Qwen / @SiliconFlowAI 阿里这一步把「小模型能打、大模型能扛」两条线同时铺开了。 智谱也发了GLM-5.3。它和GLM-5.2用同一个基座,但后训练做得更狠,编程...




