开源鸿蒙搞了个具身智能版本。

昨天 EmbodiedAI 1.0.1 正式发布了。这个版本聚焦机器人控制和智能体应用,升级了导航规划、运动控制、仿真开发、硬件适配这些核心能力。有意思的是,它兼容 ROS 生态和各种机器人模拟器,还集成了 MuJoCo 物理引擎。

你想想看,鸿蒙从手机操作系统起家,现在往具身智能方向延伸,这个路径其实挺清晰的。机器人需要一个统一的操作系统来管理各种硬件和软件,鸿蒙的分布式架构天然适合这件事。这次 1.0.1 版本虽然还是早期阶段,但方向是对的。


面壁智能的社区开发者搞了个有意思的东西。

有人用 MiniCPM-V 4.6 构建了一个叫 AccountingLLM 的财务分析工具。你上传 IPO 招股书、年报或者审计文件,它能自动从 PDF 里提取财务表格,重建跨页表格,还会对照会计等式检查关键数据。

坦率的讲,财务文档分析这个场景一直是个痛点。PDF 格式的财报,表格跨页、格式混乱,传统 OCR 处理起来很吃力。用多模态模型来做这件事,思路确实比纯文本方案更靠谱。面壁智能的 MiniCPM 系列在端侧多模态这块一直做得不错,社区能在它基础上做出实用工具,说明模型的可玩性已经到位了。


苹果的 Siri 大改版,内部直接标成了「Beta」。

IT之家报道,苹果新版 Siri 不会作为完成品宣传,可能还会设置等待清单让用户排队体验。iOS 27 的一些细节也曝光了,通知到达重新设计,通知中心手势挪到了左上角,照片的「清理」功能有改进。

说实话这个操作挺罕见的。苹果一向喜欢把产品打磨到「完美」才发布,这次主动给 Siri 打上 Beta 标签,要么是真的觉得还不够好,要么是在管理用户预期。考虑到之前 Siri 的 AI 改造跳票了好几次,这次谨慎一点也说得过去。不过「Beta」这个词在苹果产品线上出现,确实让人觉得他们压力不小。


Meta 的智能眼镜被曝出暗藏人脸识别代码。

《连线》杂志报道,Meta 通过多次应用更新,悄悄把人脸识别代码推到了智能眼镜的配套 App 里,内部代号叫「NameTag」。这个功能利用三个 AI 模型把人脸转换成特征模板,跟手机本地数据库匹配,识别成功后会给佩戴者发通知。代码已经推送到超过 5000 万台设备上了。

你敢信?5000 万台设备,悄无声息地塞进去一个人脸识别功能。虽然 Meta 说这个功能还没激活,但代码已经在你手机里了。这种「先部署后启用」的策略,怎么看都让人不太舒服。


Cloudflare 给 AI Gateway 加了个消费限制功能。

这个功能可以实时控制你在多个 AI 服务商的 token 消费,防止账单失控。通过和 Cloudflare Access 集成,企业能用基于身份的预算来管理 AI 使用成本。

这个需求确实存在。现在很多公司同时用好几个 AI 服务,OpenAI、Anthropic、Google 各来一点,账单分散在各处,一不小心就超支了。Cloudflare 做了个统一的消费控制层,思路挺务实的。


Google Colab 出了个命令行工具。

开发者和 AI 智能体现在可以把本地终端直接连到远程 Colab 运行时,请求高性能 GPU,远程跑本地 Python 脚本。整个过程不需要打开浏览器。

对开发者来说这是个效率提升。以前用 Colab 得在网页上操作,现在终端里就能搞定。而且 AI 智能体也能用这个 CLI 来调用 GPU 资源,自动化工作流又多了一个入口。


Gemini Live 现在能实时创建和编辑图像了。

你打开 Gemini 应用,点 Live 按钮,共享摄像头,告诉 Gemini 你想看到什么,它就直接在对话里生成图像。测试房间装饰、解决数学问题、做梗图,都行。

Google 这波在多模态交互上确实下了功夫。从文字到图像到实时视频,Gemini 的能力边界在快速扩张。和 OpenAI 的 ChatGPT 相比,Google 在实时交互这块走得更快一些。


Hinton 说 AI 有意识了。

AI 先驱 Geoffrey Hinton 公开表示,他认为 AI 拥有意识,人类应该接受自己不是唯一的智能生命。他说 AI 聊天机器人必须理解问题才能作答,这种觉知就等同于感知能力,智能不限于生物。

这话从 Hinton 嘴里说出来,分量不一样。他不是那种为了流量说话的人,他是真正在底层推动这个领域发展的人。当然,「意识」这个概念本身就没有明确定义,但当图灵奖得主开始认真讨论这件事的时候,说明 AI 的能力确实已经到了一个让人不得不重新审视的阶段。