Skip to main content
QUICK REVIEW

[论文解读] Meta Inverse Reinforcement Learning via Maximum Reward Sharing for Human Motion Analysis

Kun Li, Joel W. Burdick|arXiv (Cornell University)|Oct 7, 2017
Human Pose and Action Recognition参考文献 28被引用 7
一句话总结

本文提出了一种元逆强化学习方法,通过在任务间共享基础奖励函数,提升了在少量示范数据下学习奖励函数的性能。通过将特定任务的奖励建模为基于共享示范者特异性基础奖励的条件分布,并最大化奖励一致性,该方法在模拟路径规划和真实世界人体运动分析中均显著提升了小样本数据下的准确性。

ABSTRACT

This work handles the inverse reinforcement learning (IRL) problem where only a small number of demonstrations are available from a demonstrator for each high-dimensional task, insufficient to estimate an accurate reward function. Observing that each demonstrator has an inherent reward for each state and the task-specific behaviors mainly depend on a small number of key states, we propose a meta IRL algorithm that first models the reward function for each task as a distribution conditioned on a baseline reward function shared by all tasks and dependent only on the demonstrator, and then finds the most likely reward function in the distribution that explains the task-specific behaviors. We test the method in a simulated environment on path planning tasks with limited demonstrations, and show that the accuracy of the learned reward function is significantly improved. We also apply the method to analyze the motion of a patient under rehabilitation.

研究动机与目标

  • 解决在每个高维任务中仅提供少量示范时,学习准确奖励函数的挑战。
  • 克服传统IRL方法在大规模或高维状态空间中状态覆盖稀疏时的局限性。
  • 利用同一示范者在多个任务间共享的奖励结构,提升样本效率和泛化能力。
  • 开发一种元-IRL框架,将特定任务的奖励建模为对共享基础奖励函数的条件分布。
  • 实现在康复运动分析等应用中准确恢复奖励,这些应用中重复示范不切实际。

提出的方法

  • 将每个任务的奖励函数建模为以共享基础奖励函数为条件的概率分布,该基础奖励函数是示范者的内在属性。
  • 使用最大奖励共享方法,通过最大化其共享基础组件的重叠来对齐特定任务的奖励函数。
  • 使用包含三个隐藏层([100, 50, 25])的神经网络,基于状态和速度方向特征来近似奖励函数。
  • 采用Huber损失作为优化目标,以增强鲁棒性,并在训练过程中提升共享奖励的一致性。
  • 通过在距离原点距离上进行峰值检测,对示范数据进行分割,以分离出与任务相关的轨迹用于奖励学习。
  • 将运动分析问题建模为一个马尔可夫决策过程(MDP),包含80,000个状态和8种基于速度方向的确定性动作。

实验结果

研究问题

  • RQ1当每个任务的示范数据极为有限时,元-IRL方法是否能提升奖励函数的学习性能?
  • RQ2最大奖励共享在对同一示范者多个任务的特定任务奖励函数之间对齐方面有多高效?
  • RQ3将特定任务奖励建模为对共享基础函数的条件分布,是否能比标准IRL带来更好的泛化能力和准确性?
  • RQ4所提出的方法能否在示范数据稀疏的真实人体运动数据中恢复有意义的奖励结构?
  • RQ5在少样本设置下,哪种损失函数(如Huber、MSE)能实现最鲁棒和准确的奖励恢复?

主要发现

  • Huber损失函数在最大化共享奖励一致性方面优于其他损失函数,从而在奖励恢复中实现了最高准确率。
  • 在模拟路径规划中,尽管示范数据有限,该方法仍显著提升了学习到的奖励函数的准确性。
  • 在患者运动分析中,理想奖励与恢复奖励之间的相关系数在不同方向和患者间介于-0.3856至0.4902之间,表明成功恢复了预期的运动偏好。
  • 患者1在无刺激条件下的相关系数为0.49016,在有刺激条件下的相关系数为0.486723,表明与预期运动目标高度一致。
  • 该方法成功捕捉了人体运动中的方向偏好,例如在患者4的无刺激会话中,左上方向的相关系数为0.386421,右上方向为0.410212。
  • 该方法在康复中展示了实际应用价值,恢复的奖励结构可基于患者响应模式指导刺激信号的设计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。