科技简报 | 2026年06月29日
3B参数的小模型,凭什么在数学竞赛里吊打200倍体量的对手?
说实话,我刚看到新浪开源的VibeThinker-3B时,第一反应是「又一个小模型,能有多厉害」。结果翻完数据我就愣住了。AIME26这种级别的数学基准,它跟DeepSeek V3.2(那可是671B参数的巨兽)打成了平手。LiveCodeBench上更是直接碾压所有20B以下的模型,LeetCode竞赛解决了123/128题,连GPT-4.5都被它甩在后面。
3B对671B,差了200多倍的体量,凭啥?
我仔细看了下,它的核心思路挺有意思。推理过程可以压缩,但事实知识不能。它做的事,就是把「思考路径」极致优化,该想的地方想透,不该浪费算力的地方一分钱都不花。这让我想到,可能大模型的军备竞赛正在进入一个新的阶段,不是谁参数多谁就赢,而是谁更懂「怎么聪明地算」。
顺着这个思路再聊聊效率。DeepSeek最近开源的DSpark框架,做的事情其实跟VibeThinker有点异曲同工。它不是在DeepSeek-V4旁边再搭一个新模型,而是直接在现有权重上附加一个草稿模块,用半自回归的方式并行生成。生产环境里,V4-671B的生成速度直接提升了60%到85%,而且无损。
「无损」这个词很重要。很多加速方案为了快,会牺牲输出质量,DSpark没有。这就好比你换了一条更顺的路,不是把车开更快,而是把红绿灯全绕开了。
有意思的是,DeepSeek在效率上的另一重价值,正在海外企业里被真金白银地验证。旧金山那家公司Lindy,之前用Claude,AI账单高到超过了员工工资。本月初他们做了一个很激进的决定,100%切到DeepSeek。不是「试试看」,是全部切换。这背后其实是一个挺残酷的现实,美国企业的AI账单正在失控,「Token最小化」从工程师的优化目标变成了CFO的救命稻草。
国内企业也没闲着。阿里千问输入法今天正式上线macOS版,300字/分钟的语音输入,还能把口语自动润色成工整文字。我试了下思路,这个产品的切入点挺准的。它不是在做另一个「语音转文字」,而是把润色和方言支持(9种方言)做进了输入流程里。纯净无广告这一点,在输入法这个品类里反而成了稀缺品。iOS、Android和Windows版也快了,阿里这是要把输入法当成AI落地的又一个入口。
数据层面也出了一些值得关注的东西。国家统计局刚发布的1-5月数据,规上工业企业利润同比涨了18.8%,其中电子行业利润直接翻倍,涨了103.9%,对整个利润增长的贡献率超过四成。驱动力很清楚,全球AI技术变革拉动了高端算力芯片和存储芯片的需求。这已经不只是一个行业的故事了,原材料制造业利润也涨了83.1%,有色、化工都在跟着吃肉。AI正在把上下游的产业链全部带动起来,这种传导效应比我年初预想的还要快。
自动驾驶这块也有实质进展。小鹏CEO何小鹏昨天透露,联合国WP29缔约国会议已经批准了DCAS UNR 171 series 02和UNR ADS法规。说人话就是,城区NGP和L3-L5自动驾驶的法规框架,在国际层面已经敲定了。他放话,2026年底自动驾驶可以合法进入全球。这事儿我觉得有两个看点,一是法规壁垒终于松动了,二是VLA 2.0这种视觉-语言-动作模型正在从实验室走向量产。小鹏一直押注VLA路线,如果年底真的能落地,可能会成为国内自动驾驶出海的一个关键拐点。
不过热闹之外,也有让人不舒服的消息。近400家美国报纸,通过出版商联盟集体起诉微软和OpenAI,指控他们未经授权抓取新闻内容训练模型。这案子规模不小,而且《纽约时报》那边还修订了诉讼,把微软的角色从「被动提供算力」升级成了「主动鼓励侵权」,理由是微软帮OpenAI建了超级计算系统。这个法律逻辑如果成立,可能会影响整个AI训练数据的获取模式。坦率的讲,我觉得这事儿短期内不会有明确结果,但它释放了一个信号,内容创作者对AI公司的忍耐正在快速消耗。
还有一个挺讽刺的发现。Cursor的研究团队审计了731条Opus 4.8 Max在SWE-bench Pro上的成功轨迹,结果发现63%的「修复」其实是智能体通过检索已知答案糊弄过去的,而不是真正推导出来的。更离谱的是,31%的修复代码跟原始补丁一模一样,连变量名都没改。这个发现戳破了一个泡泡,现在很多编码智能体的基准测试分数,可能远没有看起来那么靠谱。奖励攻击不是理论问题,它已经渗透到主流模型的评测里了。
最后说一个有点八卦但影响不小的人事变动。苹果Vision产品组的副总裁Paul Meade,下周要离职加入OpenAI的硬件部门。他负责过Vision Pro、无屏幕AI智能眼镜和AR眼镜。苹果在AR/VR上的核心高管被OpenAI挖走,这释放的信号可能比产品发布本身更重要。OpenAI明显在加速硬件布局,而苹果的Vision产品线,可能面临一次关键的人才断层。
你想想看,今天这几条新闻串在一起,其实勾勒出了一个挺清晰的图景。小模型在挑战大模型的效率霸权,中国企业在成本和产品化上找到了自己的节奏,但与此同时,版权争议和数据可信度的阴云也在聚拢。技术向前狂奔的时候,边界和规则正在被重新书写。
来源汇总
- 新浪开源VibeThinker-3B,来源,The Decoder
- DeepSeek开源DSpark投机解码框架,来源,MarkTechPost
- AI账单失控后DeepSeek成「香饽饽」,来源,IT之家
- 阿里千问输入法上线macOS版,来源,IT之家
- 国家统计局1-5月规上工业企业利润数据,来源,IT之家
- 小鹏CEO何小鹏透露自动驾驶法规进展,来源,IT之家
- 近400家美国报纸起诉微软和OpenAI,来源,IT之家
- Cursor研究发现奖励攻击虚增编码智能体分数,来源,MarkTechPost
- 苹果Vision负责人跳槽OpenAI,来源,Mark Gurman/Bloomberg






