Skip to main content
QUICK REVIEW

[论文解读] Domain Adaptation In Reinforcement Learning Via Latent Unified State Representation

Jinwei Xing, Takashi Nagata|arXiv (Cornell University)|Feb 10, 2021
Domain Adaptation and Few-Shot Learning参考文献 21被引用 5
一句话总结

该论文提出了一种两阶段强化学习框架,通过在潜在空间中解耦领域通用特征与领域特定特征,学习一种潜在统一状态表征(LUSR)。通过仅使用领域通用嵌入在源领域进行训练,该方法实现了对未见目标领域的零样本策略迁移,相比先前方法展现出更优的泛化能力与训练效率。

ABSTRACT

Despite the recent success of deep reinforcement learning (RL), domain adaptation remains an open problem. Although the generalization ability of RL agents is critical for the real-world applicability of Deep RL, zero-shot policy transfer is still a challenging problem since even minor visual changes could make the trained agent completely fail in the new task. To address this issue, we propose a two-stage RL agent that first learns a latent unified state representation (LUSR) which is consistent across multiple domains in the first stage, and then do RL training in one source domain based on LUSR in the second stage. The cross-domain consistency of LUSR allows the policy acquired from the source domain to generalize to other target domains without extra training. We first demonstrate our approach in variants of CarRacing games with customized manipulations, and then verify it in CARLA, an autonomous driving simulator with more complex and realistic visual observations. Our results show that this approach can achieve state-of-the-art domain adaptation performance in related RL tasks and outperforms prior approaches based on latent-representation based RL and image-to-image translation.

研究动机与目标

  • 解决在视觉领域略有不同时,深度强化学习中零样本策略迁移的挑战。
  • 克服现有领域自适应方法的局限性,例如依赖多个源领域(领域随机化)或计算成本高昂的图像转换(GANs)。
  • 通过学习统一的潜在状态表征来过滤掉领域特定的差异,从而提升泛化能力。
  • 通过利用解耦的领域通用嵌入,实现在无需微调情况下的高效、实时策略迁移。
  • 在简化环境(CarRacing)和复杂、真实的环境(CARLA)中验证该方法,后者具有高保真度的视觉观测。

提出的方法

  • 使用带有解耦正则化的变分自编码器(VAE)将潜在状态表征分解为领域通用与领域特定的组件。
  • 训练一个共享编码器,从多个领域的观测图像中提取潜在嵌入,随后使用独立的解码器分别重建领域特定与领域通用的组件。
  • 在源领域强化学习训练期间,仅使用领域通用嵌入作为状态表征。
  • 在源领域使用标准深度强化学习算法(如SAC)基于LUSR进行策略学习。
  • 在未见目标领域中对训练好的策略执行零样本评估,无需进一步微调。
  • 利用t-SNE可视化与显著性图验证所学习表征的解耦性与可解释性。

实验结果

研究问题

  • RQ1解耦的潜在状态表征是否能提升强化学习中在视觉差异领域之间的零样本策略迁移性能?
  • RQ2在泛化能力与推理效率方面,LUSR相较于图像到图像转换方法与基于潜在表征的方法表现如何?
  • RQ3在CARLA等复杂视觉环境中,过滤掉领域特定差异在多大程度上提升了策略的鲁棒性?
  • RQ4领域通用与领域特定特征的解耦是否导致策略中注意力更集中、更具可解释性?
  • RQ5当源领域训练未采用领域随机化时,LUSR是否仍能在目标领域保持高性能?

主要发现

  • 基于LUSR的智能体在CarRacing与CARLA环境中均实现了最先进的零样本领域自适应性能,优于领域随机化、图像转换(CycleGAN)与基于VAE的基线方法。
  • 在CARLA环境中,LUSR在两个目标领域中均取得了最高分,且无需微调;而VAE-Embedding与CURL则表现出显著性能下降与更慢的驾驶行为。
  • t-SNE可视化结果表明,领域通用嵌入在不同领域间高度相似,而领域特定嵌入则被良好分离,验证了潜在空间的解耦性。
  • 使用LUSR训练的策略在道路中心表现出集中注意力,表明其对任务相关特征的关注优于其他方法。
  • LUSR在CARLA中优于DARLA,表明通过高β值的β-VAE进行过度解耦可能在复杂视觉任务中导致信息丢失。
  • CURL因潜在表征中存在强烈领域特定特征而无法泛化,该结论通过基于领域标签的t-SNE聚类结果得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。