[论文解读] Learning Dynamic Robot-to-Human Object Handover from Human Feedback
本文提出了一种上下文策略搜索框架,使机器人能够从嘈杂的人类反馈中学习动态、适应人类的物体交接。通过结合贝叶斯优化进行潜在奖励学习与策略搜索,机器人能够调整其运动和握力动态,以最小化作用力和加加速度,从而在静态和动态场景下实现更快、更平稳的交接——该方法通过与人类参与者的实验得到验证。
Object handover is a basic, but essential capability for robots interacting with humans in many applications, e.g., caring for the elderly and assisting workers in manufacturing workshops. It appears deceptively simple, as humans perform object handover almost flawlessly. The success of humans, however, belies the complexity of object handover as collaborative physical interaction between two agents with limited communication. This paper presents a learning algorithm for dynamic object handover, for example, when a robot hands over water bottles to marathon runners passing by the water station. We formulate the problem as contextual policy search, in which the robot learns object handover by interacting with the human. A key challenge here is to learn the latent reward of the handover task under noisy human feedback. Preliminary experiments show that the robot learns to hand over a water bottle naturally and that it adapts to the dynamics of human motion. One challenge for the future is to combine the model-free learning algorithm with a model-based planning approach and enable the robot to adapt over human preferences and object characteristics, such as shape, weight, and surface texture.
研究动机与目标
- 开发一种用于动态物体交接的机器人学习框架,能够适应人类运动和偏好。
- 解决在物理人机交互中从嘈杂人类反馈中学习的挑战。
- 使机器人能够泛化于不同的人机动态(例如行走、跑步)和物体特性。
- 通过学习最优控制策略以最小化作用力、加加速度和交接时间,提升交接流畅性。
- 结合无模型学习与未来基于模型的规划,以增强适应性。
提出的方法
- 将动态交接建模为上下文策略搜索问题,其中策略根据任务上下文(如人类运动动态)进行条件化。
- 利用人类反馈——包括绝对反馈(好/坏)和偏好反馈(优于/劣于之前)——推断潜在奖励函数。
- 应用贝叶斯优化以在反馈嘈杂的情况下稳健地学习潜在奖励函数。
- 采用策略搜索算法,优化控制参数以最大化推断出的潜在奖励。
- 集成力和运动追踪,以在物理交互过程中评估策略性能。
- 使用7自由度PR2机器人在真实世界的静态和动态交接场景中执行并评估策略。
实验结果
研究问题
- RQ1当反馈嘈杂且主观时,机器人如何从人类反馈中学习执行动态物体交接?
- RQ2在动态交接场景中,人类偏好何种控制策略特性(例如刚度、握力、时机)?
- RQ3无模型学习方法能否在不同的人机动态和物体类型间实现泛化?
- RQ4与手工调校控制器相比,所学策略在作用力、加加速度和交接时长方面表现如何?
- RQ5潜在奖励学习在无需显式奖励设计的情况下,如何促进对人类偏好的适应?
主要发现
- 机器人成功学习到动态交接,与初始手工调校控制器相比,接触力更小,加加速度更低。
- 在静态交接中,快速且平稳的指尖控制(低加加速度和低作用力)更受青睐,最佳交接时间发生在0.4至0.6秒之间。
- 在动态交接中,更柔顺的平动和转动刚度,结合牢固的指尖控制器,可减少作用力并提升鲁棒性。
- 人类参与者在动态场景中更偏好快速交接,物理接触时间持续0.3至0.6秒。
- 所学策略在动态场景中具有良好的泛化能力,显著缩短了交接时间,并减轻了对人类的物理压力。
- 视频证据表明,所学策略产生的交接动作比初始控制器更自然、更流畅。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。