科技简报 | 2026年08月27日
今天的消息看起来很杂,模型、办公软件、端侧翻译、GPU 订单都挤在一起。但把它们放到同一张桌子上,会看到一件更具体的事。
国内公司正在把模型能力往三个地方塞,办公桌、手机端,以及更便宜的 API。至于云端,那台巨大的 GPU 印钞机还在继续转。
豆包工作先把 Agent 放进了办公室
飞书与豆包团队整合后的首款 Agent 产品「豆包工作」上线。它被定位为办公场景的任务代理,支持在飞书环境中调用能力完成多步骤工作。
来源,公众号 数字生命卡兹克
这类产品最难的部分从来不是让模型写一段像样的话,而是碰到文件、权限、日程和审批时还能不把事情弄乱。办公 Agent 的竞争,接下来会落在权限边界和流程可靠性上。能少让人确认一次,又不越权,才算真省时间。
通义拿出 Qwen4 的一张预告片
通义千问开源了 Qwen3.8-Flash-Next,把它称为 Qwen4 架构的早期预览。模型为多模态 MoE,125B 总参数、每个 token 激活 6B,并引入 GDN 与 QSA 等结构改动。官方称其训练成本约为 Qwen3.7-Plus 的九分之一。
来源,Qwen Blog Retrieval
参数总量不再是最有用的尺子。开发者真正会问的是,效果够不够,延迟能不能接受,账单会不会失控。MoE 的价值正是在这里被重新检验,只有把激活成本压下去,开源模型才有机会从演示台走进生产环境。
智谱把 Flash 拉到 320B-A18B
智谱发布并开源 GLM-5.3-Flash,采用 320B-A18B 架构,也是 GLM-5 系列首个原生多模态模型。官方给出的价格很激进,限时价格约为 Claude Opus 4.8 的四十分之一。
来源,公众号 智谱 GLM
便宜不等于自动胜出。多模态、复杂工具调用和长流程任务会很快暴露模型的稳定性差异。不过价格压到这个位置,会逼着团队重新做一次模型路由,简单任务不该总由最贵的模型接手。
这场模型竞争,已经不只是跑分竞赛。
腾讯把翻译模型压进 440MB
腾讯混元将端侧翻译模型 Hy-MT2-1.8B 通过低比特量化压缩到 440MB,并已用于哔哩哔哩直播弹幕翻译。官方称,模型在 FLORES-200 测试中优于 Microsoft Translator 等商业产品。
来源,公众号 腾讯混元
端侧模型的吸引力很朴素,响应快、隐私边界清楚,也不用为每句话都付云端调用费。440MB 仍不是所有设备都能轻松吞下的体积,但它已经足够让实时翻译从「要不要联网」变成产品设计问题。
英伟达和 AWS 的订单,又多了 200 万颗 GPU
亚马逊计划在 2027 和 2028 年为 AWS 数据中心新增 200 万颗英伟达 GPU,涉及 Blackwell Ultra、Rubin 和 Rubin Ultra。此前五个月,双方刚确认过超过 100 万颗 GPU 的部署计划。
来源,TechCrunch AI
数字大到有点失去直觉。它提醒国内模型和云厂商一个现实,模型价格可以快速下探,算力供给的集中度却没有同步下降。软件层的竞争很热闹,硬件层的账本依旧很硬。
英伟达单季千亿美元营收,算力账本仍在膨胀
英伟达给出的下一季度营收指引为 1080 亿美元,预计首次单季突破千亿美元。上一季度营收 960 亿美元,同比增长 106%。
来源,Tomer Tunguz Blog
这一组数字并不等于 AI 应用已经赚到了同样多的钱。它更像是上游先押注了一个未来,云厂商和模型公司都在赌需求会追上那批已经装进机房的卡。赌赢了,规模会继续降低推理成本。赌慢了,折旧和闲置率会变成下一轮讨论的主角。
Claude in Chrome 全量开放,浏览器成了新的权限战场
Anthropic 宣布 Claude in Chrome 面向所有付费套餐开放。它可以在浏览器中执行操作,并在每次动作前通过安全分类器检查操作是否安全、是否符合请求。
来源,Claude Blog
浏览器 Agent 的爽点很直接,你不必把网页上的信息再搬运给模型。但它也会直接碰到账号、支付和后台管理系统。每一步都弹窗确认会毁掉体验,完全放开又很危险。谁能把可见、可撤销、可追溯这三件事做扎实,谁才更可能被用户交出控制权。
苹果把 M5 Ultra 推到 512GB 统一内存
苹果发布搭载 M5 Max 与 M5 Ultra 的新 Mac Studio,其中 M5 Ultra 最高支持 512GB 统一内存。Apple 同时给出 AI 性能最高提升 4.3 倍的说法。
来源,Apple Newsroom
对本地 AI 开发者来说,统一内存容量比一串峰值数字更有画面感。能在一台机器里放下更大的模型和更长的上下文,工作流就少一次远程排队。不过高规格 Mac Studio 的价格也会把它留在专业用户的小圈子里,它不是云端算力的替身。
今天留下的三条线
一边是豆包工作把 Agent 往企业协作工具里推进,另一边是通义、智谱和腾讯分别在低成本模型与端侧落地上加码。上游则用数百万颗 GPU 继续放大赌注。
这三条线最终会在同一个问题上相遇,你的任务究竟该交给云端大模型、便宜的路由模型,还是设备本地的模型。
今天的答案还没定型。但产品已经开始替用户做选择了。






