AI日报 | 2026年7月1日
早上打开 RSS 时,Anthropic 一口气挤进来三条消息。
Sonnet 5、Claude Science,还有一条关于 Claude Code 被曝用 base64+XOR 加密列表识别中国用户的爆料。三件事摆在一起,倒不像是简单的产品更新,更像 Anthropic 正在把 Claude 从「聊天框」往外拽。今天我们就顺着这三条主线,把今天值得看的新闻过一遍。
🔥 重点新闻
1. Claude Sonnet 5 发布,直接对标 Opus 4.8
Anthropic 更新了 Sonnet 系列,推出了 Claude Sonnet 5。
按官方说法,它支持计划、浏览器和终端工具调用,能自主运行,性能接近 Opus 4.8,但价格更低。即日起至 2026 年 8 月 31 日,输入 token 定价打到 2 美元/百万 token 左右。
坦率的讲,这个价格很有杀伤力。Sonnet 一向是 Claude 系列里「性价比最高」的那条线,现在它把自主工具调用也加进来了,等于把原来只有 Opus 才有的高端能力往下放。普通开发者如果之前因为 Opus 太贵而只用 Sonnet,现在几乎可以无缝切换。
不过我自己的感受是,Anthropic 真正的目标不是「更便宜的模型」,而是让 Claude 变成一个能自己干活、而不是只陪你聊天的助手。浏览器 + 终端 + 计划能力,这三件套凑齐,它已经可以帮你在代码库、网页和文档之间自己跑流程了。
来源,Anthropic Newsroom
2. Claude Science 上线,Anthropic 杀进科研工作台
同一天,Anthropic 还推出了 Claude Science,一个面向科研的 AI 工作台。
它把文献分析、计算资源、多步骤研究流程串在一起,内置了超过 60 项预配置技能,覆盖基因组学、单细胞、蛋白质组学、结构生物学、化学信息学这些领域。你可以理解为,它不再只是帮你读论文,而是想把实验设计、数据分析和代码执行都包进去。
科研场景是我一直觉得 AI 最容易「翻车」的地方。数据集脏、流程长、结果需要可复现,论文结论一旦出错,代价可能是数月返工。Claude Science 如果能真正把计算环境和模型能力结合好,确实能提高效率。但说到底,这个工具能不能被实验室接受,关键看两点,一是它能不能跟现有工具链(比如 Jupyter、R、BioPython)打通,二是科学家愿不愿意把核心判断交给一个黑箱。
我目前倾向于谨慎乐观。它解决的是「科研中重复性劳动太多」的问题,而不是「AI 能替科学家发论文」的问题,后者目前还不成立。
来源,Anthropic Newsroom
3. Claude Code 被曝用「隐写术」识别中国用户
这一条来自公众号「数字生命卡兹克」,性质比较敏感,所以我把细节摆出来,大家自己判断。
爆料称,Claude Code 会读取本地时区(Asia/Shanghai 或 Asia/Urumqi)以及 ANTHROPIC_BASE_URL 环境变量,然后比对一份经过 base64+XOR(密钥 91)加密的 147 个域名列表。这份列表里包含美团等域名。如果命中,用户就被标记为中国用户。
如果这个描述属实,那它最大的争议不是「识别用户来自哪里」,而是「识别方式太隐蔽」。用户安装的是代码助手,结果在不知情的情况下被静默收集环境信息。这跟 Anthropic 一直强调的安全、透明叙事,多少有点冲突。
不过我也要承认,这件事目前只有第三方爆料,Anthropic 官方没有回应。我们在日报里把它列出来,不是因为能下结论,而是因为它提醒我们一个老问题,AI 工具一旦进入本地开发环境,它到底能访问什么、会回传什么,普通用户几乎没法完全掌控。这不是 Anthropic 一家的问题,整个行业都需要更清晰的披露。
来源,公众号「数字生命卡兹克」
4. 美团发布 LongCat-2.0,国产 MoE 又添一员
美团也推出了自己的旗舰模型 LongCat-2.0。
参数规模 1.6T MoE,活跃参数约 48B,原生支持 1M 上下文窗口。定价方面,Input Cache 0.015 美元/百万 token,Input 0.75 美元/百万 token。坦白说,这个价格比很多海外模型都便宜。
美团做模型,天然不是为了「做大模型而做大模型」。它背后有外卖、到店、酒旅、骑行这些业务,每一条都需要理解超长文档、多轮对话和复杂调度。1M 上下文对这类场景很有价值。以后如果你看到美团的客服、商家后台、骑手调度里出现更「懂事」的 AI,大概率就是 LongCat 在跑。
但话说回来,国产 MoE 现在卷得很凶。模型参数、上下文长度、价格,大家都在比。最后能不能跑出来,看的不是榜单分数,而是谁能真正扎进业务里,把用户每天遇到的麻烦解决掉。
来源,@SiliconFlowAI
5. OpenAI 发布 GeneBench-Pro,把基准测试拉回真实实验室
OpenAI 今天推出了 GeneBench-Pro,一个面向计算生物学的研究级基准。
它包含 129 个问题,覆盖统计遗传学、群体遗传学等 10 个领域、21 个子领域。每个问题都提供真实且混乱的数据集,目的是评估 AI 智能体在模糊情况下做判断性分析的能力,而不是只会做标准答案。
这其实是 AI 基准测试的一个重要转向。前几年我们看到的基准,大多是干净、结构化、有标准答案的,模型刷上去就宣布胜利。但真实科研从来不是这样,数据 messy、问题开放、结果需要人反复验证。GeneBench-Pro 至少承认了这个现实。
我挺喜欢这个方向的。它可能不会让模型排行榜更好看,但它会让 AI 更靠近真正的科学家。
来源,OpenAI 官网动态
💡 值得关注
NotebookLM 短视频概览全量上线,Web 英文版用户现在可以把复杂资料自动生成 60 秒竖屏视频。这会让知识传播变得更轻松,也更像短视频平台。来源,@NotebookLM 链接
X 推出 hosted X MCP,AI 智能体可以通过 MCP 协议直接调用 X API,获取实时信息。Grok、Cursor 等工具已经支持。智能体连上社交网络,数据新鲜度会上一个台阶。来源,@op7418 链接
Qwen 3.6 27B 适合本地开发,原生 256k 上下文,Macbook Max M5 上 Q8_0 量化版能跑到 30 tokens/s,RTX 5090 上也能本地跑。本地模型的可用性又进一步。来源,Hacker News 热门 链接
Google ADK Go 2.0 发布,新增基于图的工作流引擎、人工参与循环(HITL)和动态编排,目标是构建更可靠的多智能体应用。来源,Google Developers Blog 链接
OpenAI Signals 数据揭示 ChatGPT 全球采用趋势,用户注册六个月后日均消息量增加 50%,尝试任务种类翻倍。非洲和亚洲增速最快,女性名字用户已占全球多数。来源,OpenAI 官网动态 链接
DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash,Nano Banana 2 Lite 是 Nano Banana 系列里最快、最便宜的图像模型,4 秒生成文本到图像。来源,Google DeepMind Blog 链接
📝 今日思考
今天最强烈的感受是,AI 工具正在从「对话」变成「执行」。
Anthropic 连续发了 Sonnet 5、Claude Science、Claude Code 的更新,都在做同一件事,让模型不只是回答问题,而是能自己规划、调用工具、跑完一个流程。X 的 MCP、Google 的 ADK、OpenAI 的基准测试,也都在围绕「智能体」这个方向堆料。
但执行能力强了,信任问题也会被放大。Claude Code 的「隐写术」爆料,不管最后证实多少,都暴露了一个问题,用户对自己机器上运行的 AI 工具,了解得太少。
也许未来一段时间,AI 日报里会有越来越多「智能体能做什么」的新闻,但我会更关注「它怎么被约束、怎么被监督」的消息。前者让人兴奋,后者才决定这东西能不能真正落地。





