Skip to main content
QUICK REVIEW

[论文解读] Addressing Sample Complexity in Visual Tasks Using HER and Hallucinatory GANs

Himanshu Sahni, Toby Buckley|arXiv (Cornell University)|Jan 31, 2019
Reinforcement Learning in Robotics参考文献 38被引用 7
一句话总结

该论文提出HALGAN,一种生成模型,通过在失败轨迹中幻化视觉目标,实现视觉环境中的事后经验回放(HER)。通过仅使用少量目标图像快照,将代理观察结果回溯性地修改为包含幻化目标,该方法在3D导航和机器人任务中实现了样本高效的强化学习,显著加速了学习速度,优于基线方法。

ABSTRACT

Reinforcement Learning (RL) algorithms typically require millions of environment interactions to learn successful policies in sparse reward settings. Hindsight Experience Replay (HER) was introduced as a technique to increase sample efficiency by reimagining unsuccessful trajectories as successful ones by altering the originally intended goals. However, it cannot be directly applied to visual environments where goal states are often characterized by the presence of distinct visual features. In this work, we show how visual trajectories can be hallucinated to appear successful by altering agent observations using a generative model trained on relatively few snapshots of the goal. We then use this model in combination with HER to train RL agents in visual settings. We validate our approach on 3D navigation tasks and a simulated robotics application and show marked improvement over baselines derived from previous work.

研究动机与目标

  • 为解决视觉强化学习中的高样本复杂度问题,将HER扩展至以视觉特征定义目标的视觉环境。
  • 通过观察幻化,将失败轨迹回溯性地转化为成功轨迹,实现在稀疏奖励视觉任务中的高效学习。
  • 通过仅在少量标注目标图像快照上进行训练,最小化对大量目标配置数据的依赖。
  • 证明幻化目标可提供有效的密集奖励信号,从而在3D导航和模拟机器人任务中实现更快的策略学习。

提出的方法

  • HALGAN是一种条件生成模型,基于少量标注图像进行训练,这些图像展示了代理相对于目标的位置,从而实现在失败轨迹中对目标状态的真实感幻化。
  • 该模型通过在代理观察中引入空间条件(基于代理与目标的相对位姿),利用图像到图像的翻译技术,修改失败轨迹中的观察,使其看起来像是目标已被达成。
  • 通过在事后重分配目标时结合HER,使用幻化的目标图像在离策略学习过程中生成密集奖励。
  • 该方法使用基于变分自编码器(VAE)的奖励函数,计算观察状态与幻化目标图像之间的基于距离的奖励,并将其缩放至与环境奖励量级一致。
  • 该方法基于代理状态和相对目标位置进行条件处理,确保幻化结果的一致性,同时保持视觉合理性与时间连贯性。
  • HALGAN的训练数据通过稀疏、标注的轨迹收集,且在强化学习训练过程中对模型进行微调,以提高幻化的真实性。

实验结果

研究问题

  • RQ1能否将事后经验回放(HER)有效扩展至以视觉外观而非状态坐标定义目标的视觉环境?
  • RQ2在仅使用少量目标图像快照进行训练的生成模型,是否能成功在失败轨迹中幻化目标状态,从而生成密集且有意义的奖励信号?
  • RQ3在视觉观察中幻化目标是否能相比标准强化学习和先前HER变体,在视觉任务中实现更快且更样本高效的策略学习?
  • RQ4该方法的性能对幻化模型训练数据集大小的敏感度如何?

主要发现

  • HALGAN+HER代理在视觉导航任务中立即开始学习,而标准DQN和DDPG代理在数百万步内均未接收到任何奖励信号。
  • 在MiniWorld连续控制环境中,仅HALGAN代理成功学会完成任务,而DDPG和朴素HER因缺乏奖励信号而完全失败。
  • HALGAN代理优于vae-her基线方法,后者虽使用基于VAE的密集奖励,但未能将幻化状态与目标达成正确关联。
  • 即使仅使用1,000张训练图像,HALGAN仍保持强劲性能,学习速度几乎无下降,表明有效幻化对数据量要求极低。
  • 该方法仅使用状态图像作为输入,即可在多个目标间实现快速泛化,推理阶段无需显式的目标状态监督。
  • 该方法对训练数据大小的变化具有鲁棒性,且可与其它奖励塑形技术(如rig-的基于距离的奖励)结合,实现进一步性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。