[论文解读] Correcting Robot Plans with Natural Language Feedback
本文提出一种通过学习将语言修正映射为残差代价函数以校正机器人运动规划的方法,从而修改机器人的规划目标。该方法在使用一次或两次语言修正时,分别实现了81%和93%的成功率,能够在未见过的环境和任务中实现泛化。
When humans design cost or goal specifications for robots, they often produce specifications that are ambiguous, underspecified, or beyond planners' ability to solve. In these cases, corrections provide a valuable tool for human-in-the-loop robot control. Corrections might take the form of new goal specifications, new constraints (e.g. to avoid specific objects), or hints for planning algorithms (e.g. to visit specific waypoints). Existing correction methods (e.g. using a joystick or direct manipulation of an end effector) require full teleoperation or real-time interaction. In this paper, we explore natural language as an expressive and flexible tool for robot correction. We describe how to map from natural language sentences to transformations of cost functions. We show that these transformations enable users to correct goals, update robot motions to accommodate additional user preferences, and recover from planning errors. These corrections can be leveraged to get 81% and 93% success rates on tasks where the original planner failed, with either one or two language corrections. Our method makes it possible to compose multiple constraints and generalizes to unseen scenes, objects, and sentences in simulated environments and real-world environments.
研究动机与目标
- 解决由于目标规范模糊、约束不足或错误而导致的机器人规划失败问题。
- 实现实时、灵活的机器人行为修正,无需完整遥控或持续的用户关注。
- 通过端到端学习语言到代价的映射,开发一种可泛化到未见过的场景、物体和自然语言命令的方法。
- 通过将修正建模为残差代价函数,将语言反馈集成到基于优化的规划中。
- 提供一种可扩展、可组合的框架,实现在执行过程中随时间动态组合多个基于语言的约束。
提出的方法
- 训练一个神经网络,从视觉观测和自然语言修正中预测残差代价函数,条件依赖于机器人的当前状态和环境。
- 在基于优化的运动规划器中,将语言修正建模为对现有代价函数的修改,从而支持动态重规划。
- 使用演示和真实代价图联合监督代价预测模型的训练。
- 将预测的代价函数与标准运动规划代价(如碰撞避免、平滑性、关节限位)结合,用于轨迹优化。
- 通过在执行过程中随时间分层叠加代价函数,实现在序列和时变条件下应用修正。
- 通过在仿真中训练并在真实机器人操作臂上部署,实现零样本泛化到新物体和新环境的端到端模拟到真实迁移。
实验结果
研究问题
- RQ1当原始规划器失败时,自然语言反馈是否能有效用于校正机器人运动规划?
- RQ2所学习的语言到代价的模型在未见过的物体、场景以及分布外的语言命令上,泛化能力如何?
- RQ3多个语言修正是否可以组合使用,以逐步优化机器人行为并提高任务成功率?
- RQ4基于语言的修正系统在多大程度上可以减少对遥控或身体接触反馈的依赖,同时保持高性能?
- RQ5在仿真中训练的单一模型是否能无需微调即成功校正真实世界中的机器人行为?
主要发现
- 该方法在仅使用一次自然语言修正时,恢复规划失败的成功率达到81%;在使用两次修正时,成功率达到93%,有效成功率从94%提升至99%。
- 该模型可泛化到未见过的物体和新环境,表现出对视觉和语言输入分布偏移的鲁棒性。
- 该框架支持可组合、时变的修正,允许用户通过多次自然语言命令逐步优化机器人行为。
- 系统成功实现从仿真到真实任务的迁移,包括杂乱场景和非模板化的自然语言,且无需重新训练。
- 即使原始规划器因目标模糊或约束不足而失败,语言修正依然有效,可在无需完整遥控的情况下实现恢复。
- 与传统的操纵杆或身体接触反馈方法相比,该方法在可用性和用户注意力需求方面表现更优,同时保持了高任务成功率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。