科技简报 | 2026年07月15日
今天的中文科技圈,热闹得像过年。
我刚扫完 AI HOT 的 RSS 流,发现国内大厂几乎全员出动。高德放了个世界模型工坊,腾讯混元把 295B 模型压到了单卡,字节又升级了图像编辑,商汤和小米也掏出新的视觉和机器人模型。
下面挑 8 条我觉得最值得聊的。
高德开放 ABot-WorldStudio,输入文字就能生成可交互世界
高德发布了通用世界模型工坊 ABot-WorldStudio,已经开放测试。它把交互式视频生成和 3DGS 场景生成统一起来,用户输入文字或图片,就能生成一个能实时交互、还能分享的 AI 世界。
工坊里内置了「时空任意门」,穿越后能跃迁到另一个完整世界。听起来有点像游戏编辑器,但重点在于「生成 + 实时交互」这两件事被捏到了一起。来源,IT之家。
腾讯混元 Hy3 量化版,1bit 单卡可部署,4bit 接近满血
腾讯混元给自家旗舰模型 Hy3(295B 参数)上了量化版。1bit 版本把权重从 598 GB 压缩到 85.5 GiB,缩小了 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本体积 169.9 GiB,性能接近满血。
这个发布直接解决的是私有化部署的痛点。以前大模型推理要一大堆卡,现在单卡就能跑,成本一下子就下来了。来源,公众号 腾讯混元。
腾讯混元 HyOCR-1.5 全栈开源,推理提速 6.37 倍
同一天,腾讯混元还开源了端到端 OCR 大模型 HyOCR-1.5。训练、推理、模型权重全开放,参数只有 1B,却覆盖了 8 种以上 text-centric 任务。
它引入的 DFlash 投机解码框架,在 Transformers 下把推理速度提升了 6.37 倍。OCR 这个领域看似不性感,但落地场景特别多,开源全栈会加速不少应用。来源,公众号 腾讯混元。
字节 Seedream 5.0 Pro,图像编辑的交互方式变了
字节跳动发布了 Seedream 5.0 Pro。图像质量和提示词理解追平 GPT-Image 2.0,综合能力仅次于后者。
真正让我感兴趣的是「可编辑」交互。你可以在图上打点、画框、涂鸦,提示词里直接 @ 标记,实现精准局部编辑。换沙发、改墙面颜色这种操作的门槛,明显被拉低了。来源,@op7418。
小米发布 Xiaomi-Robotics-U0,统一具身合成
小米推出了 Xiaomi-Robotics-U0,一个 380 亿参数的多模态自回归模型,专门用于统一具身合成。它把文生图、图像编辑、具身场景生成、具身迁移和具身视频生成联合优化。
官方说它是首个支持跨多种机器人形态的模型。小米在机器人这块一直在加码,这次从模型层开始统一,说明思路已经不只是做硬件了。来源,HuggingFace Daily Papers。
商汤开源 SenseNova-Vision-7B-MoT,用自然语言定义视觉任务
商汤发布并完全开源了 SenseNova-Vision-7B-MoT,一个多任务视觉模型。检测、OCR、GUI、深度与法线估计、分割、多视图这些任务都统一处理。
最有意思的是,它支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。也就是说,你不用再为每个任务单独训练模型,直接描述任务就行。来源,@SenseTime_AI。
面壁智能 CTO,端侧模型是 AI 落地的关键路径
面壁智能 CTO 曾国洋接受专访,核心判断是端侧模型是 AI 落地的关键路径。他们提出了「模型风洞」方法论,能在小规模实验里预测完整训练效果。
另外他们还提出「面壁定律」,知识密度每 3.5 个月翻一番。2B 参数的 MiniCPM 表现优于同期 8B 竞品。这个数据挺扎眼的,说明小模型不见得弱。来源,公众号 面壁智能。
黄仁勋,英伟达季度营收逼近千亿美元,Rubin Ultra 未延期
英伟达 CEO 黄仁勋在摩根士丹利路演中表示,公司季度营收即将逼近 1000 亿美元,而且增长速度还在加快。他否认了 Rubin Ultra 延期的传闻,称明年出货按计划进行。
这条虽然发生在美国,但会直接影响国内算力供应链和云厂商的采购预期。在当前产能紧张的背景下,任何关于英伟达节奏的消息都值得盯着。来源,IT之家。
最后说两句
今天这几条看下来,两条主线比较清楚。一条是国内大模型在往端侧、私有化和垂直场景猛扎;另一条是多模态和具身智能正在从论文快速走向产品。
我个人最想看后续实测的是高德的 ABot-WorldStudio 和字节的 Seedream 5.0 Pro。一个事关世界模型能不能真正交互,一个事关图像编辑能不能真正无门槛。
后续有实测数据的话,我再来跟大家聊。






