Skip to main content
QUICK REVIEW

[論文レビュー] Domain Adaptation In Reinforcement Learning Via Latent Unified State Representation

Jinwei Xing, Takashi Nagata|arXiv (Cornell University)|Feb 10, 2021
Domain Adaptation and Few-Shot Learning参考文献 21被引用数 5
ひとこと要約

本論文は、潜在空間におけるドメイン一般特徴とドメイン固有特徴を分離することで、潜在統一状態表現(LUSR)を学習する2段階の強化学習フレームワークを提案する。ドメイン一般埋め込みのみを用いてソースドメインで訓練することで、先行手法と比較して優れた一般化性能と訓練効率を達成し、未学習のターゲットドメインへのゼロショットポリシー転送を可能にする。

ABSTRACT

Despite the recent success of deep reinforcement learning (RL), domain adaptation remains an open problem. Although the generalization ability of RL agents is critical for the real-world applicability of Deep RL, zero-shot policy transfer is still a challenging problem since even minor visual changes could make the trained agent completely fail in the new task. To address this issue, we propose a two-stage RL agent that first learns a latent unified state representation (LUSR) which is consistent across multiple domains in the first stage, and then do RL training in one source domain based on LUSR in the second stage. The cross-domain consistency of LUSR allows the policy acquired from the source domain to generalize to other target domains without extra training. We first demonstrate our approach in variants of CarRacing games with customized manipulations, and then verify it in CARLA, an autonomous driving simulator with more complex and realistic visual observations. Our results show that this approach can achieve state-of-the-art domain adaptation performance in related RL tasks and outperforms prior approaches based on latent-representation based RL and image-to-image translation.

研究の動機と目的

  • 視覚的ドメインがわずかに異なる状況下で、深層強化学習におけるゼロショットポリシー転送の課題に対処すること。
  • 複数のソースドメインに依存する(ドメインランダマイゼーション)か、計算コストの高い画像翻訳(GAN)に依存する既存のドメイン適応手法の限界を克服すること。
  • ドメイン固有の変動をフィルタリングする統一された潜在状態表現を学習することで、一般化性能を向上させること。
  • ドメイン一般埋め込みを分離して活用することで、再訓練なしに効率的かつリアルタイムのポリシー転送を可能にすること。
  • 高精細な視覚的観測を持つ、簡略化された(CarRacing)および複雑で現実的な(CARLA)環境において、本手法の有効性を検証すること。

提案手法

  • ドメイン一般およびドメイン固有の成分に分解するため、分離正則化を施した変分オートエンコーダー(VAE)を用いて潜在状態表現を構成する。
  • 複数のドメインにまたがる観測画像から潜在埋め込みを抽出する共通エンコーダーを学習し、その後、ドメイン固有およびドメイン一般の成分ごとに別々のデコーダーを適用する。
  • 強化学習の訓練において、ソースドメインではドメイン一般埋め込みのみを状態表現として使用する。
  • LUSRを用いてソースドメインで標準的な深層RLアルゴリズム(例:SAC)を適用し、ポリシー学習を実行する。
  • 微調整なしに、訓練済みポリシーをターゲットドメインでゼロショット評価する。
  • t-SNE可視化とサリエンシー図を用いて、学習された表現の分離性と解釈可能性を検証する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン固有の特徴とドメイン一般特徴に分離された潜在状態表現は、視覚的に異なるドメイン間での強化学習におけるゼロショットポリシー転送を改善できるか?
  • RQ2LUSRは、画像対画像翻訳および潜在表現ベースの手法と比較して、一般化性能および推論効率において優れているか?
  • RQ3ドメイン固有の変動をフィルタリングすることで、CARLAのような複雑な視覚環境におけるポリシーのロバスト性はどの程度向上するか?
  • RQ4ドメイン一般およびドメイン固有の特徴の分離は、ポリシーにおけるより解釈可能で集中した注視メカニズムをもたらすか?
  • RQ5ソースドメインでドメインランダマイゼーションを実施しない状況下でも、LUSRはターゲットドメインで高い性能を維持できるか?

主な発見

  • LUSRベースのエージェントは、CarRacingおよびCARLA環境の両方で、ドメインランダマイゼーション、画像翻訳(CycleGAN)およびVAEベースのベースラインを上回る、最先端のゼロショットドメイン適応性能を達成した。
  • CARLAにおいて、LUSRは微調整なしに両方のターゲットドメインで最高スコアを記録したが、VAE-EmbeddingおよびCURLは顕著な性能低下と遅い走行行動を示した。
  • t-SNE可視化により、ドメイン一般埋め込みはドメイン間で類似しており、ドメイン固有埋め込みは明確に分離されていることが確認され、潜在空間の分離性が裏付けられた。
  • LUSRを用いて訓練されたポリシーは、道路中央に集中した注視を示し、他の手法と比較してタスク関連特徴に焦点を当てた優れた性能を示した。
  • CARLAにおいてLUSRはDARLAを上回ったが、これはβ-VAEにおける過剰な分離(βの高値)が、複雑な視覚タスクにおいて情報損失を引き起こす可能性があることを示唆している。
  • CURLは、ドメインラベルに基づくt-SNEクラスタリングにより、その潜在表現に強いドメイン固有特徴が存在することが確認され、これが一般化の失敗要因であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。