[论文解读] Instruction-driven history-aware policies for robotic manipulations
本文提出Hiveformer,一种多模态Transformer模型,整合了自然语言指令、多视角视觉观测以及长期动作历史,用于指令驱动的机器人操作。通过联合建模这些输入,Hiveformer在74项RLBench任务中达到最先进性能,能泛化至未见过的任务变体和人类编写的指令,并在物理机器人上通过微调展现出强大的现实世界迁移能力。
In human environments, robots are expected to accomplish a variety of manipulation tasks given simple natural language instructions. Yet, robotic manipulation is extremely challenging as it requires fine-grained motor control, long-term memory as well as generalization to previously unseen tasks and environments. To address these challenges, we propose a unified transformer-based approach that takes into account multiple inputs. In particular, our transformer architecture integrates (i) natural language instructions and (ii) multi-view scene observations while (iii) keeping track of the full history of observations and actions. Such an approach enables learning dependencies between history and instructions and improves manipulation precision using multiple views. We evaluate our method on the challenging RLBench benchmark and on a real-world robot. Notably, our approach scales to 74 diverse RLBench tasks and outperforms the state of the art. We also address instruction-conditioned tasks and demonstrate excellent generalization to previously unseen variations.
研究动机与目标
- 解决长时程机器人操作中因当前视角无法观测而需记忆过去动作与物体状态的挑战。
- 通过多视角输入提升在视觉遮挡与物体尺寸变化情况下的操作精度。
- 在无需微调的情况下,实现对未见任务变体与人类编写语言指令的泛化。
- 通过在仿真环境中预训练并结合真实机器人演示进行微调,弥合仿真到现实的差距。
- 在单一多模态Transformer架构中统一建模指令、视觉观测与历史信息,实现端到端策略学习。
提出的方法
- Hiveformer使用预训练的语言编码器将自然语言指令嵌入为token,与视觉和历史特征进行交叉注意力。
- 它将来自多个摄像头的当前与历史视觉观测,以及本体感觉反馈,处理为视觉token,实现多模态融合。
- 多模态Transformer关注指令、视觉与历史token拼接后的序列,以建模视觉、语言与动作历史之间的跨模态依赖。
- Transformer的输出通过UNet解码,预测7自由度机器人动作(位置、方向、夹爪状态)。
- 模型在仿真环境中通过行为克隆方法,基于合成指令进行训练,随后在真实机器人演示上进行微调,以缩小仿真到现实的差距。
- 多视角特征通过共享视觉编码器处理,并通过Transformer的自注意力机制在空间与时间维度上进行融合。
实验结果
研究问题
- RQ1统一的Transformer架构能否有效整合语言指令、多视角观测与长期动作历史,从而提升机器人操作性能?
- RQ2引入历史信息与多视角感知在长时程及遮挡敏感的操作任务中,对成功率有何影响?
- RQ3单一Hiveformer策略在多大程度上能泛化至未见的任务变体与人类编写的指令?
- RQ4在仿真中预训练并结合真实机器人数据微调,是否能显著提升真实世界性能?
- RQ5在零样本与少样本泛化方面,Hiveformer与最先进方法相比,在多样化任务类别中的表现如何?
主要发现
- 在推按钮任务中,Hiveformer在每种变体仅使用10次演示时达到96.8%的成功率,使用50次演示时达到99.6%,展现出强大的少样本泛化能力。
- 在未见的推按钮任务变体中,Hiveformer在10次演示下达到71.7%的成功率,50次演示下达到74.1%,表明对新任务顺序具有稳健的泛化能力。
- 在积木塔任务中,Hiveformer在仅10次演示下对未见变体达到49.8%的成功率,表明其能有效学习序列化操作技能。
- 在人类编写的指令上,Hiveformer在已见变体上达到73.1%的成功率,在未见变体上达到50.1%,表明即使在训练数据为合成指令的情况下,仍具备良好的迁移能力。
- 在真实机器人实验中,预训练并微调后的Hiveformer在未见变体上达到85.7%的成功率,显著优于随机初始化模型(13.3%),展现出强大的仿真到现实迁移能力。
- Hiveformer在74项多样化的RLBench任务中均表现出泛化能力,尤其在需要高精度与长期记忆的任务(如堆叠与按钮按压)中性能提升显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。