Skip to main content
QUICK REVIEW

[论文解读] Transfer Learning for Related Reinforcement Learning Tasks via Image-to-Image Translation

Shani Gamrian, Yoav Goldberg|arXiv (Cornell University)|May 31, 2018
Generative Adversarial Networks and Image Synthesis参考文献 36被引用 40
一句话总结

论文显示,通过非对齐GAN分离视觉转移和控制策略,可以实现有效的零-shot转移以及相关强化学习任务的样本效率提升,在Breakout变体和Road Fighter上得到验证,并且从不完美示范中进行模仿学习可提升结果。

ABSTRACT

Despite the remarkable success of Deep RL in learning control policies from raw pixels, the resulting models do not generalize. We demonstrate that a trained agent fails completely when facing small visual changes, and that fine-tuning---the common transfer learning paradigm---fails to adapt to these changes, to the extent that it is faster to re-train the model from scratch. We show that by separating the visual transfer task from the control policy we achieve substantially better sample efficiency and transfer behavior, allowing an agent trained on the source task to transfer well to the target tasks. The visual mapping from the target to the source domain is performed using unaligned GANs, resulting in a control policy that can be further improved using imitation learning from imperfect demonstrations. We demonstrate the approach on synthetic visual variants of the Breakout game, as well as on transfer between subsequent levels of Road Fighter, a Nintendo car-driving game. A visualization of our approach can be seen in https://youtu.be/4mnkzYyXMn4 and https://youtu.be/KCGTrQi6Ogo .

研究动机与目标

  • 证明标准深度RL对小的视觉变化泛化能力差,微调迁移效果不佳。
  • 提出将视觉转移与策略学习分离,以实现跨视觉差异大但动力学相关的任务的有效迁移。
  • 展示非对齐GAN能够将目标域视觉映射到源域视觉,以复用已学策略。
  • 提出一种模仿学习框架,在GAN映射不完美时提升迁移策略。

提出的方法

  • 在基础任务上训练源RL代理(如Breakout),并在视觉改变的目标任务上测试。
  • 通过微调尝试标准迁移,使用不同冻结/新建层的配置;观察无法迁移的情况。
  • 使用非对齐GAN(UNIT/CycleGAN框架)在没有成对数据的情况下学习从目标域到源域的视觉映射G。
  • 通过在目标环境中使用源策略参数θ与映射后的状态 G(t) 交互评估迁移后的策略 π(a|G(t); θ)。
  • 当GAN映射不完美时,将迁移后的策略视为不完美示范并应用模仿学习以提高样本效率。
  • 可选地将模仿学习更新与基于策略的RL(A2C)更新结合,按论文中的算法细节执行。

实验结果

研究问题

  • RQ1经过源任务训练的深度RL策略能否在动力学变化极小的情况下泛化到视觉上被改变的目标任务?
  • RQ2微调是对视觉变体RL任务的有效迁移方法吗,还是会阻碍学习?
  • RQ3通过将视觉转移与控制动力学分离,代理能否在不同关卡/变体之间迁移知识?
  • RQ4通过非对齐GAN实现的零-shot视觉转移是否能产生可用的策略,当GAN不完美时,模仿学习能否改进这类策略?

主要发现

  • 微调在Breakout变体之间的迁移很大程度上失败,有时收敛速度甚至与从头训练一样慢或表现更差。
  • 不进行视觉转移在Road Fighter不同关卡之间迁移得到的分数为零,表明策略失效。
  • 使用非对齐GAN进行零-shot视觉转移(G将目标视觉映射到源视觉)能够在目标任务上获得高分,且需要的目标环境交互显著更少。
  • 在GAN选项中,基于UNIT的翻译在Breakout上通常优于CycleGAN;Road Fighter的结果则更混合;GAN质量直接影响策略性能。
  • 来自不完美GAN示范的模仿学习进一步提升目标任务性能和样本效率,能够在比从头训练需要更少的环境交互下达到高分。
  • 该方法还提供了一个实用的、面向任务的度量标准,用于基于下游强化学习性能评估非对齐GAN。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。