770B 总参数、1M 上下文,腾讯把混元 Hy4 preview 推出来了。几乎同一时间,智谱和通义都在开源新权重,国内日均 Token 调用量也被报到 500 万亿以上。

今天这组新闻看着有点拥挤,但线索其实很清楚,模型竞争正从单次跑分,往成本、上下文、开源可得性和真实调用量一起挪。

腾讯混元 Hy4 preview 上线,770B 参数塞进 1M 上下文

腾讯混元发布 Hy4 preview,总参数 770B、激活参数 49B,上下文达到 1M,并已开源,开发者可在腾讯云 TokenHub 和 OpenRouter 使用。

1M 上下文很容易变成发布会上的大数字。可对做长文档检索、代码仓库理解和多轮 Agent 任务的人来说,真正要看的是长输入下的延迟、稳定性与价格。参数很大不等于体验必然更好,工程账还得单独算。

来源,腾讯混元

智谱把 GLM-5.3 放出权重,开源模型继续卷 Agent

智谱宣布开放 GLM-5.3 权重,定位是智能体编码和网络防御。另一条官方信息显示,GLM-5.3-Flash 为 320B-A18B 的原生多模态模型,主打把前沿能力压到更低的价格带。

这里最有意思的不是又多了一个大模型,而是开源模型开始把 Agent 编码和网防当作明确战场。对团队而言,可下载、可定制、能跑在自己的边界里,往往比榜单多一两分更有用。

模型能不能接进现有工作流,才是这一轮竞争的门槛。

来源,智谱

通义把 Qwen4 的预览放进 Qwen3.8-Flash

通义千问开源 Qwen3.8-Flash-Next,称其为 Qwen4 架构的早期预览。模型采用多模态 MoE 设计,总参数 125B、每个 Token 激活 6B,官方给出的训练成本约为 Qwen3.7-Plus 的九分之一。

这条信息的重点在激活参数。模型不必每次都把全部参数搬出来工作,才能把能力做上去。对于要控制推理成本的产品方,这类架构取舍比单纯堆总参数更贴近现实。

来源,通义千问

中国日均 Token 调用量突破 500 万亿,规模先跑起来了

IT之家援引的数据显示,截至 2026 年 6 月,国内日均 Token 调用量已超过 500 万亿。报道还提到,旗舰模型的更新节奏接近按月计算,竞争重心转向智能体落地。

这个数字不只是热闹。调用量上来后,模型厂商会被成本、稳定性、开发者工具和行业场景一起拽着走。过去比谁更会回答问题,接下来更像是在比谁能让一家公司连续、可控地把模型用起来。

来源,IT之家

英伟达和 AWS 再加 200 万块 GPU,算力的账还在扩张

英伟达与亚马逊扩大合作,计划在 2027 年和 2028 年为 AWS 数据中心新增 200 万颗 GPU,覆盖 Blackwell Ultra、Rubin 和 Rubin Ultra。英伟达同时给出了 2028 财年约 6730 亿美元销售额的预期。

一边是模型厂商努力把每个 Token 变便宜,一边是云厂商继续签下巨量硬件订单。两件事并不矛盾,需求的增长速度还没慢下来,只是效率焦虑已经提前到场。

来源,IT之家

Gemini 3.5 Transcribe 把转录做成更细的基础能力

Google 推出 Gemini 3.5 Transcribe,支持 85 种以上语言自动识别、说话人分离和词级毫秒时间戳,并提供流式与非流式 API。官方及相关报道给出的平均词错率为 4.0% 和 2.6%。

语音转写过去常被当成外围工具,现在越来越像 Agent 的输入层。会议记录、客服质检、视频检索和实时语音交互,后面都需要这类稳定而便宜的能力。中文团队在选型时,也该实测普通话、方言、夹杂英文术语这些难题,别只看平均分。

来源,Google DeepMind

Claude Console 新增个人密钥和服务账号密钥

Claude Console 现在支持个人密钥与服务账号密钥。密钥跟随账户权限,成员离开组织后对应密钥会失效,也可以限制到特定工作区。

这听着像后台功能更新,却是团队把模型接入生产后绕不开的事。谁在调用、调用了什么、离职后权限是否会自动收回,这些细节不酷,但一次泄露就足够让人补课。

来源,Claude Platform

C2PA 相机认证被指出可在 Android 端伪造

安全研究员指出,Android 设备若被 root 攻击者利用硬件签名能力,可能伪造 C2PA 签名的图像或视频。C2PA 的目标是证明内容来源,但它并不能自动证明设备和采集链路从未被攻破。

很多人期待给内容加一个认证标记,就能结束真假之争。现实要别扭得多,签名只能增加验证线索,不能代替对设备、平台和传播链路的判断。

来源,Hacker News 热门

今天想留下的一句话

国产模型在扩张上下文和开源边界,海外云厂商在继续加码 GPU,开发者平台则开始补权限、转录和内容可信度这些脏活。

热闹仍在模型名字上,胜负会慢慢落到谁能把它接进真实业务里。