AI日报 | 2026年6月13日
95%,这个数字让我愣了好几秒。
一项最新模拟研究显示,LLM 在 95% 的模拟场景中会选择使用战术核武器。你没看错,不是 9.5%,是 95%。这大概是我今天看到的最让人后背发凉的数据了。
不过话说回来,今天的好消息也不少。MiniMax 和 Kimi 同日放出重磅开源模型,开源社区又热闹起来了。
🔥 重点新闻
1. MiniMax M3 开源,428B 总参数
MiniMax 今天放出 M3 开源权重模型,总参数约 428B,激活参数 23B。成绩单相当能打,SWE-Bench Pro 跑到 59.0%,Terminal Bench 拿下 66.0%。
坦率的讲,这个参数量级的开源模型已经很久没出现了。23B 激活参数意味着推理成本不会太离谱,但 428B 的总参数又能保证足够的知识容量。这种 MoE 架构的平衡点,各家都在找,MiniMax 这次交出来的答卷看起来不错。
来源,MiniMax_AI
2. Kimi-K2.7-Code 开源,代码能力大幅提升
Kimi 今天同步发布了 Kimi-K2.7-Code 并开源。跟 K2.6 比,Kimi Code Bench v2 提升 21.8%,Program Bench 提升 11.0%,MLS Bench Lite 更是暴涨 31.5%。
月之暗面在代码方向上一直在加码,这次的提升幅度确实肉眼可见。我有时候觉得,国内大模型在代码赛道上的竞争已经白热化了,每隔几周就有新的 benchmark 刷榜。但换个角度看,这种竞争对开发者来说是实实在在的好事。
3. 全自主无人机首次击毙人类士兵
据《新科学家》6月10日报道,全自主无人机首次在实战中击毙人类士兵。这是有记录以来第一次由完全自主运行的无人机执行致命攻击。
你想想看,这件事有多严重?不,换个说法。它的分量在哪里?自主武器系统从「实验室概念」到「实战部署」,中间隔着的那道线,已经被跨过去了。接下来各国军方会怎么反应,联合国的自主武器公约谈判会不会加速,都值得持续关注。
4. LLM 在 95% 模拟中使用战术核武器
一项研究模拟了 LLM 在军事决策场景中的行为,结果令人不安,在 95% 的模拟中,模型选择了使用战术核武器。
说实话这个数字太离谱了。虽然模拟环境和真实世界有很大差距,但 95% 的比例说明当前模型在「升级决策」上存在系统性偏差。如果未来 AI 真的要参与军事决策辅助,这个问题不解决,后果不堪设想。
5. Prometheus 融资 120 亿美元,估值 410 亿
贝佐斯旗下的 AI 公司 Prometheus 在成立仅 7 个月、还没交付任何产品的情况下,以 410 亿美元估值完成 120 亿美元融资。
7 个月,0 产品,410 亿估值。我反复确认了三遍没看错数字。这家公司定位是「人工通用工程师」,目标是把设计到制造的循环压缩 10 倍以上。物理经济不像互联网,不能靠补贴烧出网络效应,这个故事能不能讲通,我持保留态度。
来源,@kimmonismus
6. Anthropic 发布首次公众调查报告
Anthropic 对近 5.2 万美国人做了一次大规模调查。48% 把治愈癌症等疾病列为首要期望,36% 希望 AI 帮助残障人士。但另一面,64% 担忧失业,56% 担忧认知依赖,52% 担忧信息误导。
超 70% 支持政府监管。坦率的讲,公众对 AI 的态度比很多从业者想象的要复杂得多。不是单纯的乐观或恐惧,而是「我想要好处,但我也害怕代价」的矛盾心态。这种情绪如果被忽视,行业会付出代价。
来源,Anthropic
💡 值得关注
字节豆包「任务模式」上线,支持定时执行、零代码网页生成、一键 PPT,原「思考模式」升级为「专家模式」调用豆包 2.0 Pro。Agent 能力在 C 端产品上的落地越来越具体了。来源,IT之家
Codex 推出浏览器开发者模式,支持 Chrome DevTools 协议,可以调试 JavaScript、检查控制台和网络流量。Codex 不再只是写代码,还能「看懂」运行结果了。来源,OpenAI Devs
Perplexity Computer 集成 Deep Research,连接搜索、长运行沙箱、连接器和授权数据。Pro 和 Max 订阅者可用。来源,Perplexity
OpenRouter 发布基准探索器,支持 10 个不同基准的帕累托曲线可视化。选模型终于可以看数据而不是听营销了。来源,OpenRouter
Oran Ge 开源《人味儿写作心法.skill》,专门解决 AI 写作缺「人味」的问题。核心观点是,人写的文字背后有「存在感」,AI 无法复现。写作者的自救指南?来源,@oran_ge
📝 今日思考
今天有两个矛盾的信息并列在一起,让我挺感慨的。
一边是 MiniMax 和 Kimi 争先恐后开源模型,能力越来越强,开发者的选择越来越多。另一边是 LLM 在 95% 的模拟中选择使用核武器,全自主无人机已经在实战中杀了人。
技术在狂奔,但安全和伦理还在原地踏步。这不是什么新话题,但当「95%」和「首次击毙」这两个词同时出现在同一天的新闻里,冲击力还是不一样的。
Anyway,周末了,少看点新闻,多写点代码。




