好文章2026-04-21 19:00

机器人要真正进工厂和设施,不只要会抓东西,还得先学会“看懂仪表”

导读

具身 AI 过去一年最容易被记住的画面,通常都和“抓取”有关。

Google DeepMind 在 2026 年 4 月 14 日发布 Gemini Robotics-ER 1.6,把仪表读数、多视角理解和成功检测放到前台。它提醒人们,具身 AI 要进入真实工作流,竞争重心正在从 demo 转向判断质量。

Gemini Robotics-ER 1.6 官方模型卡页面页首
图注:Google DeepMind《Gemini Robotics-ER 1.6》模型卡页面页首。官方材料把 model card、safety performance 和 PDF 入口放在同一入口里,说明这次更新强调的是进入真实场景前的判断与评估能力。来源:Google DeepMind。

机械臂拿起杯子,机器人把东西放进框里,系统根据一句口令移动到另一个点位。这些演示很直观,也很容易传播,因为它们能快速证明一件事:模型已经不只会在屏幕里思考,而开始能把推理投向物理世界。

但如果你认真看 Google DeepMind 2026 年 4 月 14 日发布的 Gemini Robotics-ER 1.6,会发现它这次重点强调的东西,已经不太是这些了。

这篇文章里最重要的升级点不是“抓得更稳”,而是“看得更准、判得更明白”。多视角理解、空间推理、指向、计数、成功检测、仪表读数、物理安全约束,这些词比单纯的操作动作更靠前。它甚至明确提到,新的仪表读数能力来自和 Boston Dynamics 的紧密合作。

这其实是在透露一个很关键的变化:具身 AI 真正想进入真实工作流,首先要解决的不是“手会不会动”,而是“脑子会不会正确理解环境”。

真实场景里,判断往往比动作更难

在实验室和演示视频里,动作往往最醒目。因为观众看得见一个机械系统在移动、抓取、执行,这天然比“它在内部做了什么判断”更容易被感知。

但到了工厂、设施维护、巡检、仓储、机房或半自动工作站这种场景里,真正更难的常常不是动作本身。

难的是机器人到底有没有看懂当前环境。它看到的是不是正确的仪表?多视角下是不是还在指向同一个对象?任务真的完成了,还是只是看起来像完成了?在“不要碰液体”“不要拿超过 20 公斤的物体”这种限制下,它能不能先判断,再行动?

Google DeepMind 这次把这些能力都放到前面,说明它们已经不再被当成次要补充,而是在变成下一阶段具身 AI 的主问题。

这很像软件代理从“会点按钮”走向“会理解流程”的那一步。对机器人来说,也是一样:真正要进入现实工作流,不能只会执行命令,还得会理解任务所处的物理世界。

仪表读数为什么是一个特别好的信号

Gemini Robotics-ER 1.6 的升级点里,“instrument reading” 很值得单独拿出来看。

这听上去不是最炫的能力,甚至有点笨重:读压力表、读 sight glass、理解指针位置。可它恰恰是一个非常现实的工业信号。因为一旦一个系统开始能稳定做这类事,就说明它正在触碰那些真正有工作价值的场景。

设施巡检、设备维护、流程确认、状态检查,这些任务的共同特点是:它们不一定需要复杂手部操作,却高度依赖环境理解和状态判断。一个机器人如果能稳定读懂仪表、判断异常、确认执行是否成功,它离进入真实设施就比“会端杯子”更近一步。

这也是为什么 DeepMind 文章里说得很明确,Gemini Robotics-ER 1.6 是 reasoning-first model。它想证明的不是机器人更像人,而是机器人更像一个可靠的上层推理系统,能把现实环境先变成可判断的信息。

“成功检测”说明行业已经不满足于好看的演示

另一处很值得注意的是,DeepMind 反复提到 success detection

这不是一个很容易在大众叙事里被强调的词,因为它没有“机器人抓起东西”那么上镜。但它其实非常关键。任何真正要在现实场景里工作的系统,都必须回答一个问题:我怎么知道自己真的完成了任务,而不是只是执行了一个看起来像任务的动作。

这个问题在现实里太常见了。开关是不是打开了,阀门是不是到位了,物体是不是放到了正确位置,读数是不是进入安全区间。没有这些判断,很多 demo 都只能停留在“会做动作”,而不能升级成“会交付结果”。

DeepMind 把它单独拿出来,意味着行业正在从“看见机器人动了”转向“机器人能不能稳定交差”。

具身 AI 现在更像在补‘巡检脑’,而不是‘机械手’

如果把这篇更新放回更大的具身 AI 竞争里,会发现一件很有意思的事。

过去行业最热的时候,很多公司都在突出 VLA、动作控制和任务执行,仿佛只要模型能生成足够好的动作,机器人很快就会进入大规模应用。但越往真实场景走,越会发现动作只是最后一环。前面还有感知、空间推理、目标理解、任务规划、环境约束、安全边界和结果确认。

Gemini Robotics-ER 1.6 这次真正像是在补一颗“巡检脑”。

它更适合被理解成一个上层 reasoning 模型,负责把现实世界里的复杂状态转成更清晰的任务判断,再去调用搜索、VLA 或第三方函数。这种结构非常像今天软件 agent 的架构:一个上层推理层,下面接一堆执行工具。

如果这个方向成立,具身 AI 的落地会更像分层系统,而不是一个单模型包打天下的方案。

安全被写得更重,也说明场景开始变真了

文章里还有一个信号容易被忽略:DeepMind 花了不少篇幅讲安全。

不仅说 Gemini Robotics-ER 1.6 是“our safest robotics model yet”,还提到它在对抗性空间推理任务上更符合 Gemini 安全策略,在文本和视频的伤害风险识别上也优于之前基线,并更能遵守像“不能处理液体”“不能拿太重物体”这样的物理约束。

很多时候,安全被强调,反而说明系统开始更靠近真实部署。因为只有当一个东西真的有可能进入现实环境,人们才会认真追问它会不会误判、会不会伤人、会不会在不确定条件下做出危险动作。

这也是具身 AI 与纯软件 AI 的一个明显区别。前者的错误不是只停留在答案里,而会立刻变成物理后果。

这次更新真正说明的是,具身 AI 的门槛变了

所以,Gemini Robotics-ER 1.6 最值得写的地方,不是 DeepMind 又把机器人模型做得更强了一点,而是它暴露出一个更现实的行业判断:具身 AI 的下一阶段竞争,不会只围绕动作生成,而会越来越围绕判断质量。

谁更会理解环境、谁更会读懂仪表、谁更会确认任务成功、谁更能遵守物理安全边界,谁就更接近真实设施、真实工厂和真实巡检工作流。

这件事听上去没有 demo 那么性感,却更接近商业化。因为真实世界需要的,从来不是一台会做几个漂亮动作的机器,而是一套在复杂环境里仍然知道自己在干什么的系统。

如果说上一阶段的具身 AI 重点是“让机器人开始会动”,那 Gemini Robotics-ER 1.6 预告的下一阶段,可能就是“让机器人先学会更可靠地理解它要进入的世界”。

把互动收束在正文之后

第一版正式上线会把点赞、收藏和评论放在正文之后,保留杂志式留白,同时让登录用户能留下真实反馈。

互动

评论区

评论会在审核通过后公开显示。

0/500· ⌘/Ctrl + Enter 提交

当前环境尚未配置 Supabase,互动功能暂时不可用。

想参与互动?前往登录

  • 还没有公开评论 — 欢迎成为第一位留言的人。累计历史互动 0,新评论将从这里重新开始。

相关阅读