科技简报 | 2026年07月14日
今天一开电脑,腾讯混元就连发了两款模型。中文科技圈的节奏感,忽然就变得紧凑起来。
再加上 OpenAI 掏出一份给普通用户的提示词指南,面壁智能、商汤、字节也在各自赛道扔出新东西。这一天的信息量,足够我们聊一会儿。
1. 腾讯混元连发两款模型,Agent 和 OCR 都覆盖到了
腾讯混元今天动作很大。
先是发布了 Hy3,一个 295B 总参数、21B 激活参数的 MoE 模型。它主打 Agent 向,定位不是单纯聊天,而是能在真实业务里跑任务。微信服务里 10 亿+ 用户已经被它覆盖,从 preview 到正式版改了 50 多个业务反馈点。腾讯内部 WorkBuddy 的任务成功率,也从 7 成提到了 97.5%。
这个数字听着有点夸张,但也能理解,微信体系本身就是 Agent 最好的试验田。
紧接着,混元又开源了 HyOCR-1.5,端到端 OCR 大模型,把训练、推理、模型权重全放出来了。1B 参数,覆盖 8 种以上 text-centric 任务,推理速度提升了 6.37 倍。OCR 这件事一直被当成”基础能力”,但能把文档、票据、表格真正搞准,对 B 端业务的价值其实很大。
2. 面壁智能谈端侧模型,”知识密度”成了新指标
面壁智能 CTO 曾国洋在一次专访里强调,端侧模型是 AI 落地的关键路径。
他们提出一个原创方法论叫”模型风洞”,意思是可以在小规模实验里预测完整训练效果。基于这个思路,他们又给出”面壁定律”,知识密度每 3.5 个月翻一番。2B 参数的 MiniCPM 表现比同期 8B 竞品还好。
端侧这块,如果模型能在手机上跑得更省、更稳,很多应用才能真正落地,而不是停留在 demo 阶段。
3. 商汤开源多任务视觉模型,用自然语言定义新任务
商汤发布并完全开源了 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等任务的视觉模型。
它比较有意思的地方在于,可以用自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。也就是说,视觉模型不再被”检测就做检测、分割就做分割”的框架绑死。
4. 字节 Seedream 5.0 Pro,图像编辑门槛明显下降
字节跳动发布的 Seedream 5.0 Pro,图像质量追平了 GPT-Image 2.0,综合能力仅次于它。
最有感的是它的”可编辑”交互。用户可以在图上打点、画框、涂鸦,提示词里直接 @ 标记,实现精准局部编辑。换沙发、改墙面颜色、加个人,不再需要复杂的工作流。这种把”修图”变成”对话”的方向,可能会让传统图像编辑工具很难受。
5. OpenAI 给普通用户写提示词指南,从结果出发,少写步骤
OpenAI 整理了一份面向普通用户的提示词指南,核心思路是以结果而非步骤开头,用一两条硬性规则替代逐步骤脚本。
这个建议其实挺反直觉的。以前大家写提示词都喜欢说”第一步…第二步…第三步…”,但这份指南认为,直接告诉模型你要什么,比教它怎么做更有效。Chat 处理快速任务,Codex 类 Agent 处理复杂任务,分工也更清晰了。
6. 11 天重写 Bun,Claude Fable 5 刷出百万行代码
开发者 Jarred Sumner 借助 Claude Fable 5,用 11 天把 JavaScript 运行时 Bun 从 Zig 重写为 Rust。64 个实例并行,写了超过 100 万行代码,API 费用大约 16.5 万美元。
他选择 Rust 的主要原因是 Zig 频繁出现内存错误,Rust 能在编译阶段就拦住很多问题。这个项目与其说是”AI 写代码”的炫技,不如说是一个大型迁移工程的效率实验。它也让我们看到,未来大型重构的成本结构可能会完全改变。
7. Meta 数据中心扩到 5GW,投资额超 500 亿美元
Meta 宣布把路易斯安那州数据中心算力扩到 5GW,总投资超过 500 亿美元。这是全球最大 AI 基础设施投资之一。
Meta 承诺承担全部能源及水资源费用,还额外投超 10 亿美元改善当地道路和供水系统。这么大的手笔,说明巨头们对算力储备的焦虑没有减弱,反而在加剧。
8. 苹果起诉 OpenAI,硬件计划或受拖累
苹果在美国起诉 OpenAI,指控其挖角 400 名员工、窃取工程机和机密文件。即使指控最终无法证实,分析师也认为 OpenAI 的硬件计划可能受重创,双方本就脆弱的合作关系会进一步削弱。
这件事真正的看点,不只是法律层面的对错。它反映了 AI 巨头之间人才、数据和硬件资源的争夺,已经进入白热化阶段。
今天的简报就到这儿。你最想深入了解哪一条?欢迎在评论区聊聊。





