7月30日,Google DeepMind 发布 Gemini Robotics 2。这是面向具身智能的新一代模型组合,旨在让机器人完成更具适应性的全身动作、精细操作以及多机器人协作。
据 Google 介绍,其中的 Gemini Robotics 2 是视觉—语言—动作(VLA)模型,可把视觉与语言输入转换成运动控制;它可用于人形机器人和双臂机器人。新模型将视觉与语言输入转化为运动控制,覆盖从移动到双手操作的全身动作。
此次更新还包括 Gemini Robotics ER 2 和 Gemini Robotics On-Device 2。前者负责理解环境、规划持续数分钟的多步骤任务并跟踪执行进度;后者针对机器人设备端运行优化,Google 称其可借助少量示例在数小时内适配新的双臂机器人形态。
在安全侧,Google 同时推出 ASIMOV-Agentic 基准,用于衡量具身推理系统在不确定情形下拒绝不安全工具调用、判断任务可行性以及请求人工介入的能力。Google 表示,Gemini Robotics ER 2 已在 Google AI Studio 提供使用,VLA 与端侧模型则面向早期合作伙伴开放。
需要注意的是,上述性能与安全结论来自发布方材料。机器人在真实环境中的可靠性,仍取决于硬件、传感器、任务边界与现场安全措施等因素。
来源:Google DeepMind 于2026年7月30日发布的产品公告。本文为中文编译与整理。
您必须登录或注册以后才能发表评论