2026年7月31日,Google DeepMind发布了Gemini Robotics 2,这是面向机器人控制的"视觉-语言-动作"(VLA)大模型,为机器人赋予了"全身智能"。
Gemini Robotics 2包含三个模型:全身控制VLA模型、具身推理模型ER 2、端侧On-Device 2。最令人惊叹的是,同一个checkpoint可以驱动三种不同机器人本体——Apptronik Apollo 2 + SharpaWave手、Apollo 2 + Inspire手、Franka Duo双机械臂。端侧版本几小时就能适配全新机器人身体。
这个迁移速度是真正的突破点。以往强化学习/模仿学习训练的策略绑定特定硬件,换台机器就要重训。DeepMind用大规模预训练+少样本微调把适配成本压到了小时级。多机器人协作也在demo中展示,清洁房间的任务可以两台机器人分工完成。