Skip to main content
QUICK REVIEW

[论文解读] PsiPhi-Learning: Reinforcement Learning with Demonstrations using Successor Features and Inverse Temporal Difference Learning

Angelos Filos, Clare Lyle|arXiv (Cornell University)|Feb 24, 2021
Reinforcement Learning in Robotics参考文献 88被引用 5
一句话总结

本文提出PsiPhi-Learning,一种新颖的强化学习框架,通过利用多个智能体的未标注示范(无需访问其奖励或目标),结合后继特征(successor features)与逆时序差分学习(ITD),实现高效学习。该方法将共享的环境动态与智能体特定的偏好解耦,从而实现更快、更样本高效的训练,并支持零样本迁移至新任务,兼具理论性能保证与对基线方法的实证优势。

ABSTRACT

We study reinforcement learning (RL) with no-reward demonstrations, a setting in which an RL agent has access to additional data from the interaction of other agents with the same environment. However, it has no access to the rewards or goals of these agents, and their objectives and levels of expertise may vary widely. These assumptions are common in multi-agent settings, such as autonomous driving. To effectively use this data, we turn to the framework of successor features. This allows us to disentangle shared features and dynamics of the environment from agent-specific rewards and policies. We propose a multi-task inverse reinforcement learning (IRL) algorithm, called \emph{inverse temporal difference learning} (ITD), that learns shared state features, alongside per-agent successor features and preference vectors, purely from demonstrations without reward labels. We further show how to seamlessly integrate ITD with learning from online environment interactions, arriving at a novel algorithm for reinforcement learning with demonstrations, called $ΨΦ$-learning (pronounced `Sci-Fi'). We provide empirical evidence for the effectiveness of $ΨΦ$-learning as a method for improving RL, IRL, imitation, and few-shot transfer, and derive worst-case bounds for its performance in zero-shot transfer to new tasks.

研究动机与目标

  • 解决在奖励不可观测且目标未知的情况下,利用多智能体示范进行强化学习的挑战。
  • 通过后继特征,将共享的环境动态与智能体特定的策略和偏好解耦。
  • 构建一个统一框架,整合离线逆强化学习与在线强化学习,以提升样本效率。
  • 通过利用解耦的共享特征与任务特定偏好表示,实现对新任务的零样本适应。
  • 为所提出框架中的零样本迁移提供理论最坏情况性能边界。

提出的方法

  • 提出逆时序差分(ITD)学习,从无奖励监督的未标注轨迹中推断每个示范者的后继特征与偏好向量。
  • 采用多任务逆强化学习公式,联合学习共享累积量(环境特征)、各智能体的后继特征与偏好向量。
  • 采用广义策略提升(GPI)将自车智能体的策略与推断出的示范者策略结合,生成用于在线强化学习的改进经验。
  • 通过混合训练方案将ITD与在线强化学习集成,同时利用示范与在线环境交互。
  • 利用后继特征实现零样本迁移,仅更新任务特定的偏好向量,而保持共享特征固定。
  • 采用通用后继特征近似器,实现对大量示范者的可扩展性,且参数量不随示范者数量线性增长。

实验结果

研究问题

  • RQ1我们能否在无奖励标注的情况下,从未标注示范中学习到共享的环境表征与智能体特定的策略?
  • RQ2当示范者的目标未知且可能不一致时,如何有效将多任务示范整合到在线强化学习中?
  • RQ3后继特征能否实现对训练期间未见的新任务的零样本迁移?
  • RQ4在此设置下,能否为零样本迁移提供理论性能保证?
  • RQ5与标准模仿学习和强化学习基线相比,该方法在样本效率与最终性能方面表现如何?

主要发现

  • ITD学习在离线多任务逆强化学习中,即使无奖励标签,性能也优于或等同于先前的IRL方法。
  • 当示范者目标与学习者任务部分对齐时,PsiPhi-Learning 显著加速学习过程,在样本效率上优于标准强化学习。
  • 当示范无效或具有误导性时,该方法能平滑退化为标准强化学习,避免了朴素模仿方法中常见的性能崩溃。
  • 通过仅更新偏好向量,即可实现对未见任务的零样本迁移,实证结果表明在新目标上能有效实现策略适应。
  • 推导出理论最坏情况性能边界,表明该方法在零样本迁移场景中保持有界次优性。
  • 在网格世界与交通仿真环境中的实证评估表明,该方法在样本效率、收敛速度与对无关或冲突示范的鲁棒性方面均有显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。