Anthropic 昨天深夜放出了 Claude Code 的大升级,Karpathy 直接发了条长推说这是「LLM 的第三次变革」。

第一次是预训练,第二次是 RLHF,第三次是什么呢?Karpathy 说的是「LLM 学会使用工具」。这次 Claude Code 的升级核心就是 agent 能力的大幅提升,不只是写代码,而是能自主规划、执行、调试一整套流程。

我自己的感受是,过去半年 coding agent 的进化速度确实快得有点离谱。从最初的「能跑通 hello world」到现在的「能独立完成中等复杂度项目」,中间只隔了大概半年时间。

字节掀桌,豆包 2.1 成本暴砍 80%

字节跳动的豆包模型升级到了 2.1 版本,两个数据很扎眼,API 成本直接降了 80%,编程能力追平 Claude Opus 4.7。

你想想看,结果会怎样呢。一个国内大厂的模型,在编程这个硬核领域跟 Anthropic 的旗舰打平了,同时价格只有对方的五分之一。这对整个开发者生态的冲击会非常大,尤其是国内的独立开发者和小团队。

坦率的讲,价格战这件事字节一直很擅长。但这次不一样,这次不是靠补贴硬打,而是真的在模型能力上追上来了。豆包 2.1 的 benchmark 数据还没看到完整版,但编程这块的实测反馈确实不错。

GPT-5.6 大量实测流出,本周四可能登场

OpenAI 的 GPT-5.6 实测截图已经在各大社区流传开了,有消息说本周四正式发布。

从流出的测试来看,GPT-5.6 在多模态理解和长上下文处理上有明显提升。不过具体参数和定价还没公布,现在下结论有点早。

有意思的是,这次泄露的实测内容质量很高,不像是偶然泄露,更像是有计划的预热。OpenAI 的营销节奏一直很稳,每次重大发布前都会有「恰好」的泄露来吊胃口。

微信 AI 助手大规模内测,朋友圈要变天了

微信的原生 AI 助手开始大面积灰度了。

功能覆盖面比想象中要广,不只是聊天助手,还能总结朋友圈、管理公众号订阅、甚至帮你写回复。有个细节挺有意思的,AI 可以根据你和某个好友的聊天记录,自动生成回复建议。

不过也有人担心隐私问题。你想想看,AI 要读取你的聊天记录才能提供这些服务,数据安全怎么保证?微信官方的说法是所有处理都在本地完成,但具体实现细节还没公布。

腾讯买出了 AI 半壁江山

36 氪有篇深度报道,梳理了腾讯过去一年在 AI 领域的投资布局。数据很惊人,腾讯通过投资和收购,已经控制了国内 AI 赛道近一半的优质标的。

从大模型到应用层,从算力到数据,腾讯的策略很清晰,自己不一定要做最强的模型,但一定要把最强的模型都纳入自己的生态。这跟微软投资 OpenAI 的逻辑有点像,但腾讯的覆盖面更广。

说实话我也不确定这种策略最终效果如何,但至少在资源整合这块,腾讯确实走在了前面。

具身智能独角兽昆仑行,90 天融资数十亿

一家叫昆仑行的具身智能创业公司,刚注册就成了独角兽,90 天内融了数十亿元。

团队背景很强,核心成员来自清华和几个头部机器人公司。他们的技术路线是通用人形机器人,目标场景是工业制造和物流。

具身智能这个赛道今年确实火得不行。但坦率的讲,从 demo 到量产还有很长的路要走。昆仑行能拿到这么多钱,很大程度上是因为赛道热度,真正的能力还要看产品落地。

Codex 突然爆了,被骂了一年终于翻身

OpenAI 的 Codex 从去年被吐槽到现在,最近突然火了。

原因很简单,底层模型换了。之前 Codex 用的是 GPT-4 系列,现在换成了最新的 o3 模型,代码生成质量直接上了一个台阶。很多开发者反馈说,现在的 Codex 已经能独立完成中等复杂度的编码任务了。

这个故事挺有意思的。一个产品被骂了一年,不是因为产品设计不行,而是因为底层模型不够强。模型一换,体验直接翻倍。AI 时代的产品逻辑确实跟传统软件不一样,核心竞争力在模型层,不在应用层。

Home Assistant 的 AI 乌龙,但方向没错

Home Assistant 最近搞了个 AI 功能,结果出了个乌龙,AI 把用户家里的灯当成了「可疑设备」给关了。

虽然是个 bug,但智能家居 + AI 这个方向确实要变天了。Home Assistant 作为最大的开源智能家居平台,它的 AI 探索代表了一种趋势,让 AI 来理解和控制你的家居环境,而不是靠你手动设置自动化规则。

想想就觉得兴奋,以后你家里的设备不再是死板的「if this then that」,而是能真正理解你的生活习惯,主动做出调整。当然,前提是别再把你的灯当成可疑设备了。