• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI漫剧创作
AI 对话

谷歌 DeepMind 推出 Gemini Robotics ER 2:机器人开始拥有“会聊天、懂世界、能规划”的高级大脑

谷歌 DeepMind 推出 Gemini Robotics ER 2:机器人开始拥有“会聊天、懂世界、能规划”的高级大脑
小峰
1天前
AI摘要
本文介绍谷歌DeepMind推出的具身推理模型Gemini Robotics ER 2,它作为机器人的“高级大脑”,填补了机器人系统的任务理解层短板,支持复杂多步骤任务规划、状态追踪、多机协作,推动机器人智能从单动作执行向具身Agent演进,不过当前规模化落地仍面临硬件、安全等问题,需先从受控场景切入。

使用AI智能大模型技术生成


机器人正在从“听指令做动作”,走向“理解任务再行动”。

Google DeepMind 宣布推出 Gemini Robotics ER 2。按照官方口径,它是面向机器人的具身推理模型:既能与人类对话,也能理解物理世界,并为复杂、多步骤任务做规划。更重要的是,ER 2 并不直接替代底层动作模型,而更像机器人系统里的“高级大脑”,负责理解、推理、规划、分派和解释,再把具体运动执行交给底层 VLA(视觉-语言-动作)模型。

这件事值得关注,不只是因为谷歌又发布了一个机器人模型,而是因为机器人智能正在从“能不能动起来”,转向“能不能理解现实世界里的任务”。

一、Gemini Robotics ER 2 到底是什么?

如果说传统机器人系统更像一套自动化程序,那么 Gemini Robotics ER 2 更像一个能理解环境、沟通意图、规划步骤的任务大脑。

官方将它描述为 embodied reasoning model,也就是“具身推理模型”。它面向的不是普通聊天,而是让机器人在真实或模拟物理环境里理解人类需求:桌上有哪些物体?哪些动作有先后关系?任务是否已经完成?如果一个机器人不够,能不能让多台机器人协作?

这类能力和普通大模型不同。聊天模型可以回答“怎样整理桌面”,但机器人模型必须判断杯子、纸张、工具和空间位置之间的关系,还要把任务拆成可执行步骤,并在执行过程中持续追踪状态。

所以,ER 2 的关键不是“机器人会说话”,而是让对话、感知、推理和行动规划进入同一个链路。

二、它补的是机器人系统里最难的“任务理解层”

过去很多机器人展示,重点在机械臂能不能抓取、双足能不能行走、视觉模型能不能识别物体。但真实工作场景里,更难的是任务理解。

比如用户说:“把桌面整理一下,别碰我的咖啡,把会议资料放到左边。”这不是一个单动作命令,而是一组包含约束、顺序、空间关系和安全边界的任务。

Gemini Robotics ER 2 的价值就在这里。它能够理解文本、图像、视频、音频等输入,并输出文本形式的推理和规划结果;它可以与人类对话、解释自己的计划,也可以将运动执行交给底层机器人模型。

这意味着,机器人系统开始出现更清晰的分工:ER 2 做高级理解和规划,VLA 模型负责动作执行,机器人硬件负责落地动作。

三、多步骤任务,才是真正的分水岭

让机器人拿起一个物体,和让机器人完成一个多步骤任务,是两件完全不同的事。

多步骤任务需要模型同时处理四个问题:

  • 先做什么、后做什么;
  • 当前环境发生了什么变化;
  • 任务是否已经完成;
  • 如果遇到阻碍,是否需要调整计划。

官方资料提到,Gemini Robotics ER 2 支持复杂任务规划、任务完成状态追踪、高级空间逻辑,也能协调多台机器人完成共同任务。它还可以使用工具,例如结合搜索、日历等外部信息,为任务规划补充上下文。

这说明机器人智能的竞争,正在从“单个动作成功率”进入“长期任务完成率”。未来衡量机器人是否有用,不只看它能不能抓住一个杯子,而是看它能不能理解一个目标,并稳定把目标推进到结果。

四、对行业意味着什么?机器人需要一个通用“大脑层”

如果机器人要进入家庭、仓储、制造、医疗、服务业,仅靠固定流程是不够的。现实环境太复杂:物体会移动,任务会变化,人会临时打断,安全边界也必须实时判断。

这就需要一个更通用的“大脑层”。它不一定直接控制每个关节,但要能理解环境、理解人类意图、规划步骤、调用工具、协调不同执行单元。

Gemini Robotics ER 2 释放出的信号正是如此:机器人模型不再只是“把视觉变成动作”,而是把对话、感知、世界知识、推理规划和执行接口串起来。

对开发者来说,这类模型可能让机器人应用从“写死流程”走向“任务级编排”。对企业来说,未来更重要的是建立评测、仿真、安全控制、人工接管和任务日志体系,而不是只看演示视频是否炫酷。


五、也要看到边界:机器人不是一夜之间变成通用劳动力

机器人领域最容易被高估,也最容易被低估。

ER 2 代表了具身智能的重要进展,但它并不意味着机器人马上可以在任意环境里自主完成所有任务。真实世界中的硬件可靠性、动作安全、环境变化、成本、部署复杂度和责任边界,仍然是机器人规模化落地必须解决的问题。

更现实的路径,是先从受控场景开始:仓储分拣、实验室操作、办公服务、家庭辅助、巡检维护、教育演示等。模型越强,越需要配套的安全机制和评测体系,尤其是当机器人能调用工具、协调多机器人并执行长链路任务时。


结语

Gemini Robotics ER 2 最值得看的地方,不是“机器人终于会聊天”,而是机器人开始拥有更强的任务理解和多步骤规划能力。

过去,机器人更像会执行动作的机器;现在,它正在被接入一个能对话、能理解物理世界、能拆解任务、能解释行动的智能层。

如果说大模型让软件开始出现 Agent,那么 Gemini Robotics ER 2 这类模型则在推动机器人走向“具身 Agent”。真正的变化不是机器会说话,而是机器开始理解:人想让它完成什么,以及怎样一步步把事情做完。

当然,落地仍需谨慎。具体可用范围、API 能力、输入输出限制、安全机制和商业部署方式,都应以 Google DeepMind 与 Google 官方最新文档为准。




参考口径说明:本文基于 Google DeepMind 官方发布信息、Gemini Robotics ER 2 模型页/模型卡、Google AI Studio / Gemini API 可用性信息及权威媒体报道整理。涉及模型能力、可用范围、输入输出、工具调用和安全策略,以 Google 官方最新说明为准。

0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关资讯
  • 谷歌 DeepMind 推出 Gemini Robotics ER 2:机器人开始拥有“会聊天、懂世界、能规划”的高级大脑

  • H3 对比 SD2 实测|Seedance 一家独大的局面,已经被打破

  • 当下 AIGC 核心热点| 3.8 实测:仅一折成本,真能追上第一梯队大模型?

  • 腾讯WorkBuddy联合腾讯文档推出“人机双写”:AI 办公开始从侧边栏,走进同一份文档腾讯 WorkBuddy 联合腾讯文档推出“人机双写”:AI 办公开始从侧边栏,走进同一份文档

  • 360发布纳米Work:给首批用户1亿Token,企业智能体开始从“能聊”走向“能干活”

热点资讯

每日AI资讯-2026年8月07日

1天前
每日AI资讯-2026年8月07日

每日AI资讯-2026年8月04日

4天前
每日AI资讯-2026年8月04日

每日AI资讯-2026年7月31日

8天前
每日AI资讯-2026年7月31日

每日AI资讯-2026年8月06日

2天前
每日AI资讯-2026年8月06日

每日AI资讯-2026年8月03日

5天前
每日AI资讯-2026年8月03日
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有