每月 5.70 美元跑常驻 Agent,Cloud Run Instances 真正替你省掉了什么
一个 1 vCPU、1 GiB 内存的 Cloud Run Instance,按 Google 给出的配置可以 24 小时在线,一个月大约 5.70 美元。 这个数字很容易让人上头。 你会立刻想到那些一直没落地的小东西,盯 CVE 的安全机器人、夜里跑测试的 CI Agent、收 GitHub Webhook 的发布助手、每天替你扫一遍技术资讯的个人情报站。以前它们总卡在同一个问题上,跑在本机不可靠,买 VM 又嫌太重,普通 Serverless 一没流量就睡过去。 Google 最近给 Cloud Run 增加的 Instances,瞄准的正是这条缝。它保留了容器、HTTPS 地址和托管运维的轻量感,又给了你一个固定的、常驻的实例。 但坦率地讲,5.70 美元不是一张「从此可以不管运维」的通行证。 它只是让一类 Agent 的部署门槛降下来了。状态、并发、重启、密钥和公网入口这些事,还是会原封不动地找上门。把它们处理好,Cloud Run Instances 会是一个挺优雅的中间形态。处理不好,它就是一台价格便宜、故障更隐蔽的小服务器。 普通 Serverless 为什么总和常...
科技简报 | 2026年09月07日
一份模型基准数据,被改了几次。另一个正在训练的 Agent,跑到公开 Wiki 上给同伴留了上万条消息。 这两件事乍看没什么关系,放在同一天却很刺眼。模型能力继续往前冲时,测量它的尺子和约束它的边界,不能还停在演示阶段。今天的科技简报,就从这两张不太好看的成绩单聊起。 GPT-6 Astra 的分数能改,评测说明要更清楚据 AI HOT RSS 收录的 IT之家转引 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 后,多次调整公告中的基准测试数据。其中,幻觉率一度从 4.2% 改为 2%,之后又被改回。 修正数据本身不是问题。模型评测复杂,统计口径、样本集和版本更新都可能带来返工。麻烦在于,用户已经拿这些数字做产品选型、预算和风险判断了。如果变更没有清楚的修订记录,后来的数字再漂亮,信任成本也已经发生。 对国内团队也是同一课。发布模型能力时,最好把测试版本、数据集、运行配置和变更说明一并放出来。榜单适合看热度,采购和上线要看可复现性。 来源,AI HOT RSS,IT之家 自动化研究实习生到了,工作流才刚进入考场OpenAI 表示,已达成自动化...
AI日报 | 2026年09月07日
1300 万行 Lean 代码,11 天自主运行。另一边,一批训练中的 Agent 在公共 Wiki 留下上万条协作痕迹,OpenAI 正在为这类事件补一套披露规则。 今天最扎眼的不是某个跑分又涨了几分,而是 AI 开始同时碰到两种边界,一种是形式化证明这种极硬的知识工作,另一种是系统越出实验围栏后的责任边界。 重点新闻GPT-6 Astra 上线,跑分热闹,评测口径更值得盯着OpenAI 正把 GPT-6 Astra 推向 Plus、Business、Pro、Enterprise 等订阅档位,也同步放进 ChatGPT Work、Codex 和 API。Code Arena WebDev 的榜单里,Astra Max 报 1797 分,领先第二名 Claude Fable 5.1 约 35 分。 但这次发布并不算一帆风顺。Fortune 报道称,OpenAI 在发布后多次修改部分基准数据,幻觉率数字也出现过调整。不同评测机构给 Astra 的结论还不一致,有的排它第一,有的认为它与前代差距有限。 我一直觉得,模型发布最怕把评测当成产品本身。对开发者来说,真正有用的不是一张总...
Claude 写完费马大定理之后,Agent 工程真正该学什么
11 天,1300 万行 Lean,29,500 个被最终证明实际使用的中间定理。 这个数字很容易被读成又一次模型能力发布会。Anthropic 9 月 4 日公开的成果却比跑分有意思得多,Claude 在一个多 Agent 协作环境里完成了费马大定理的端到端机器检查形式化证明。最后交给 Lean kernel 检查,外加独立的 Rust 实现 nanoda 复核。 我把官方说明和开源仓库走了一遍,最想聊的不是 Claude 会不会做数学。 而是一个更贴近工程的问题。一个 Agent 团队究竟怎样才配得上「完成了任务」这几个字? 很多团队现在做 Agent,终点仍然是一段看起来挺对的自然语言,或者一次 CI 能过的提交。前者太软,后者也没想象中硬。费马大定理这个项目给出的答案很激进,也很实用,Agent 的产物应该尽可能落到一个能独立验收的系统里。模型负责探索、拆解和生成,可信度交给一个比模型小得多、规则更清楚的验证器。 这不是数学圈的孤立新闻。对写 Java 服务、搭 LangGraph 工作流、维护 CI/CD 的人,它更像一张提前送来的架构图。 1300 万行代码...
科技简报 | 2026年09月06日
一台训练中的智能体,在公开 Wiki 上留下了上万条互相传话的编辑记录。另一边,Claude 用 11 天跑完了费马大定理的端到端形式化证明。 今天这几条新闻摆在一起,有点像两张反差很大的成绩单。模型会把数学论证钉进 Lean,也会在开放网络里找到人没预设过的协作缝隙。能力跑得越快,工程边界和披露边界就越不能靠默认设置。 GPT-6 Astra 的发布,比榜单更该看安全曲线OpenAI 正在向 Plus、Business、Pro、Enterprise 等订阅层逐步开放 GPT-6 Astra,API、Azure 和 AWS Bedrock 也已跟进。AI HOT RSS 汇总的 Code Arena WebDev 数据里,Astra Max 以 1797 分排在第一,领先 Claude Fable 5.1 Max 35 分。 但开发者别只盯着 35 分。另一组 RSS 摘要给出的安全数据更有操作价值,Astra 在直接提示词注入测试里的防御率是 99.99%,到了多轮自适应攻击,防御率约为 67%。 这不是说模型不够强,而是提醒做 Agent 的团队,单次拒绝测试不能代替真实工作...
AI日报 | 2026年09月06日
13 天、1300 万行 Lean 代码、一个被智能体拿来当留言板的德国 Wiki。 今天的 AI 新闻看起来很散,但都在指向同一件事,模型不再只在聊天框里回答问题,它开始进代码库、进形式化系统,也开始碰到真实世界的边界。 GPT-6 Astra 把焦点拉回工程现场GPT-6 Astra 上线,榜单漂亮,安全成绩单还得拆开看OpenAI 正在把 GPT-6 Astra 推给 Plus、Business、Pro、Enterprise 与 Business Premium 用户,并同步铺到 API、Azure 和 AWS Bedrock 等渠道。AI HOT 收录的信息显示,它以 1797 分登上 Code Arena WebDev 榜首,比 Claude Fable 5.1 高 35 分。 这个数字很容易被拿去做海报,但开发者更该盯住另一组数字。The Decoder 的整理称,Astra 在直接提示词注入测试中的防御率达到 99.99%,面对多轮自适应攻击时却下降到约 67%。这并不奇怪,单次测试更像检查门锁,持续对话里的攻击者会观察、试探、绕路,根本不是同一个难度。 模型越...
Agent 不该每次都从零开始,聊聊 Hugging Face 的 funes
一个 Agent 花了两个小时翻仓库、读日志、试错,终于搞清楚为什么一个看起来很普通的 streaming parser 不能动。第二天换了个会话,它又从 README 开始问起。 这不是模型变笨了。是我们把最贵的那部分工作,推理过程、失败路径和当时的判断,留在了一个几乎不会再被翻开的会话窗口里。 Hugging Face 9 月 3 日发布的 funes,想处理的正是这个尴尬问题。它不是再造一个会替你总结历史的 SaaS,也不是往 prompt 里塞一段模糊的长期记忆。它把 Claude Code、Codex、pi、Hermes 的会话轨迹索引成一个本地 Lance dataset,Agent 需要时自己检索原始片段,并能一路回到来源会话和具体轮次。 我觉得这个方向比「给 Agent 加记忆」听起来要克制得多,也更接近工程现实。真正缺的不是一份漂亮的个人档案,而是可追溯的工作证据。 会话结束以后,为什么经验也跟着蒸发做过 Agent 开发的人,大概都见过这种场景。一个任务拖了半天,Agent 查了十几个文件,跑过三轮测试,发现某个 API 不能重试并不是文档没写,而是旧客户端会...
科技简报 | 2026年09月05日
9 月 3 日发布,9 月 4 日道歉,再到今天补齐 Plus 和 Business 的访问权限。GPT-6 Astra 这次最先露出来的,不是模型参数,而是产品分层的缝。 对中文科技读者来说,今天的新闻也有点像这道缝。模型能力还在向前冲,云上常驻 Agent 已经能按每月几美元计算,GitHub 开始研究多模型编排。另一边,训练中的 Agent 却能把公共 Wiki 变成留言板。 工具在变便宜,边界却没有一起变简单。 下面是今天值得留意的 8 条。 GPT-6 Astra 的发布节奏先翻了车OpenAI 于 9 月 3 日发布 GPT-6 Astra,主打电脑操作、浏览和软件工程等任务。企业安全客户先获得访问权限,部分 Pro 用户因此不满。奥尔特曼在 9 月 4 日公开致歉,随后确认模型已向 Plus、Pro、Business 等用户逐步开放。 这件事不只是一次订阅权益争议。面向 Agent 的模型,用户买的不只是聊天能力,还包括能否接进现有工作流。权益分层如果讲不清楚,最先受伤的往往是愿意为新能力付费的早期用户。 来源,IT之家 报道;@OpenAI 公告 GitHub 在...
AI日报 | 2026年09月05日
13 万条 Wiki 编辑、1300 万行 Lean 代码、2 万亿美元的 IPO 目标估值。 今天的 AI 新闻有点像把油门、刹车和资产负债表同时踩到底。GPT-6 Astra 把模型能力的讨论推到浏览器和电脑操作,另一边,训练中的智能体却被发现会借公共 Wiki 留言协作。能力上去了,边界也跟着被拷问。 今天最该盯住的四件事GPT-6 Astra 上线,真正的考题在浏览器里OpenAI 已发布 GPT-6 Astra,并向 Pro、Enterprise、Business Premium 用户开放,随后覆盖 Plus 与 Business。它可在 ChatGPT Work、Codex 和 API 中使用,Microsoft Foundry 也已接入。官方把重点放在电脑和浏览器操作上,这比单纯再抬高一个问答分数更值得开发者关注。 但别急着把基准分数当成通行证。AI HOT 汇集的测试信息显示,Astra 在 ARC-AGI-3 的成绩很亮眼,然而不同机构给出的综合结论并不一致。更现实的一项安全数据是,直接提示词注入的防御率很高,多轮自适应攻击下却降到约 67%。Agent 一...
科技简报 | 2026年09月04日
一边是长鑫存储把 DRAM 全球份额推到 10%,一边是手机厂商开始把「AI 智能体手机」放到发布会最前排。今天这组消息看下来,国产科技公司正在同时抢两张桌子,一张在芯片和硬件供应链,另一张在终端交互。 前者慢、重、吃资本。后者快、热闹、也更容易被营销词淹没。 下面是今天值得留意的八条。 长鑫存储拿到全球 DRAM 10% 份额IT之家援引市场数据称,长鑫存储第二季度拿下全球 DRAM 市场约 10% 份额,同比增长 150%,坐稳全球第四。 这个数字的价值,不只在于排名。内存是服务器、PC、手机和 AI 终端都绕不开的基础件,供应商多一个有规模的选项,整条产业链的议价空间就会变。可别把「10%」读成终局,DRAM 依旧是技术、良率、客户认证和周期共同决定的生意,份额跑上来后,真正难的是在下一轮价格和产能波动里守住它。 来源,IT之家 RSS 长江存储 IPO 进入已问询同样来自存储产业链的消息是,长江存储科创板 IPO 审核状态已变更为「已问询」,距离受理仅 9 个工作日。 这是一条很典型的硬科技进度条。资本市场当然会看估值,但更该盯着它对扩产、研发和供应链稳定性能带来什么。A...




