Skip to main content
QUICK REVIEW

[论文解读] Generative Adversarial Imitation from Observation

Faraz Torabi, Garrett Warnell|arXiv (Cornell University)|Jul 17, 2018
Reinforcement Learning in Robotics参考文献 35被引用 95
一句话总结

GAIfO 使用类似 GAN 的框架从仅状态演示中进行模仿,在具备动作信息的方法中达到竞争性表现,并且在高维视觉任务中表现突出。

ABSTRACT

Imitation from observation (IfO) is the problem of learning directly from state-only demonstrations without having access to the demonstrator's actions. The lack of action information both distinguishes IfO from most of the literature in imitation learning, and also sets it apart as a method that may enable agents to learn from a large set of previously inapplicable resources such as internet videos. In this paper, we propose both a general framework for IfO approaches and also a new IfO approach based on generative adversarial networks called generative adversarial imitation from observation (GAIfO). We conduct experiments in two different settings: (1) when demonstrations consist of low-dimensional, manually-defined state features, and (2) when demonstrations consist of high-dimensional, raw visual data. We demonstrate that our approach performs comparably to classical imitation learning approaches (which have access to the demonstrator's actions) and significantly outperforms existing imitation from observation methods in high-dimensional simulation environments.

研究动机与目标

  • 在专家动作不可用时,利用仅状态演示来激发模仿学习。
  • 提出一个以状态转移为核心的观测模仿学习(IfO)通用框架。
  • 开发一个无模型的 GAIfO 算法以恢复状态转移成本并训练策略。
  • 展示 GAIfO 在低维和高维(视觉)环境中的有效性。

提出的方法

  • 为 IfO 定义状态转移成本 c: S x S -> R,而不是状态-动作成本。
  • 将从观测的 IRLfO(使用 c 和无动作的状态转移)公式化。
  • 引入 GAIfO 作为具备状态转移占用度量的具体 RL + GAN 公式。
  • 使用判别器 D 区分专家与模仿者的状态转移并训练策略去愚弄 D。
  • 将 GAIfO 的目标推导为一个极小极大博弈,在状态转移上使用类似 GAN 的损失(D),并使用 TRPO 进行策略优化。
  • 提供低维状态与视觉状态表示的实际实现。

实验结果

研究问题

  • RQ1在无法获取示例者动作的情况下,观测模仿是否能恢复具有竞争力的策略?
  • RQ2如何利用状态转移信息来使模仿者的行为与专家行为对齐?
  • RQ3带有 GA 正则化的 IRLfO 与基于 GAN 的状态转移判别之间的理论联系是什么?
  • RQ4GAIfO 在低维与高维(视觉)演示中的表现如何?
  • RQ5GAIfO 是否能够扩展到以视觉数据为主的复杂、循环性任务?

主要发现

  • GAIfO 在低维任务中达到或超过其他 IfO 基线。
  • GAIfO 的表现与 GAIL 相当,尽管无法访问示例者动作。
  • GAIfO 在高维视觉环境中优于现有的 IfO 方法。
  • GAIfO 在需要循环或时间延展行为的任务中仍然有效,而时间对齐的方法表现不佳。
  • 在视觉演示中,GAIfO 超越了 BCO 和 TCN,接近由 TRPO 训练的视觉状态策略的性能。
  • 该方法表明可以在没有动作信息的情况下使状态转移分布与专家对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。