Skip to main content
QUICK REVIEW

[論文レビュー] Domain Adversarial Reinforcement Learning

Bonnie Li, Vincent François-Lavet|arXiv (Cornell University)|Feb 14, 2021
Domain Adaptation and Few-Shot Learning参考文献 26被引用数 6
ひとこと要約

本論文では、ドメイン識別器を用いた敵対的訓練によりドメイン不変表現を学習する手法であるドメイン敵対的強化学習(DARL)を提案する。この手法により、視覚的ドメインの変化(背景、コントラスト、明るさの変化など)がある状況下でも、ゼロショット一般化性能が向上する。特に、未知の視覚ドメインにおける性能低下が顕著に軽減され、例えば、最も遠く離れたテスト環境では、SACと比較して性能低下が23.5%にまで低下する(SACでは74.1%)。ドメイン間で特徴分布を一致させつつ、タスク関連の情報を保持することで、性能が向上する。

ABSTRACT

We consider the problem of generalization in reinforcement learning where visual aspects of the observations might differ, e.g. when there are different backgrounds or change in contrast, brightness, etc. We assume that our agent has access to only a few of the MDPs from the MDP distribution during training. The performance of the agent is then reported on new unknown test domains drawn from the distribution (e.g. unseen backgrounds). For this "zero-shot RL" task, we enforce invariance of the learned representations to visual domains via a domain adversarial optimization process. We empirically show that this approach allows achieving a significant generalization improvement to new unseen domains.

研究の動機と目的

  • 視覚的観測が環境によって変化する(背景、コントラスト、明るさの変化など)状況下で、深層強化学習におけるゼロショット一般化性能を向上させること。
  • 訓練中に特定の視覚ドメインに過剰に適合してしまうため、標準的なRLエージェントが脆くなる問題に対処すること。
  • ドメインシフトに対して不変な表現を学習すると同時に、効果的なポリシー学習に必要なタスク関連動的特性を保持すること。
  • 訓練時にテストドメインのデータにアクセスできない状況下でも、新しい未知の視覚ドメインへの強力な転送を可能にすること。

提案手法

  • 表現エンコーダーとドメイン識別器を敵対的に訓練し、エンコーダーがドメイン識別器を欺くようにドメイン不変特徴を生成することを目的とする。
  • 異なる視覚的背景を持つ少数の訓練ドメインで、標準的なRLアルゴリズム(例:SAC)を用いてエージェントを訓練する。
  • ドメイン識別器が特徴の元となるドメインを分類する能力を最小化するように、ドメイン敵対的損失を用いてエンコーダーを最適化する。
  • ドメイン識別器を訓練ループに統合し、ポリシーと表現エンコーダーを勾配更新により同時に最適化する。
  • t-SNEとL2距離を用いて、訓練ドメインとテストドメイン間の視覚的および特徴空間の類似度を測定する。
  • 静的および非静的テストドメイン(自然な動画背景、動的雑音など)において、一般化性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1特徴空間における敵対的ドメイン整合性が、視覚的ドメインシフトを伴う深層RLにおけるゼロショット一般化を向上させ得るか?
  • RQ2ドメイン敵対的エージェントの性能は、未知の視覚ドメインにおいて標準的なRLエージェントと比較してどのように異なるか?
  • RQ3DARLで学習された表現は、新しい視覚ドメインでテストされた際、特徴空間において訓練分布にどれほど近いか?
  • RQ4表現におけるドメイン不変性は、多様な視覚的背景においてより安定的かつ強固なポリシー性能をもたらすか?

主な発見

  • DARLは、潜在空間で最も遠く離れたテスト環境(最も不似合い)において23.5%の性能低下にとどまったが、SACと比較して74.1%の低下を示しており、優れた耐性を示した。
  • L2距離による平均特徴間の距離で測定したところ、DARLの特徴分布はすべてのテスト環境で訓練分布に近く保たれていたのに対し、SACの特徴は顕著に乖離していた。
  • DARLの性能は潜在空間におけるL2距離と強く相関しており、訓練分布に近い距離にあればあるほど、一般化性能が向上した。
  • 自然な動画背景を有する非静的環境において、DARLはSACと比較してより安定的かつ一貫性のある性能を示した。SACは環境によって性能が大きく変動していた。
  • t-SNEの可視化により、DARLの表現はよりコンパクトでドメイン不変であることが確認された一方、SACの表現は視覚的ドメインシフトに対して敏感であった。
  • ドメイン識別器は、特徴の元となるドメインを分類する能力を著しく低下させ、特徴空間における効果的なドメイン不変性が達成されたことを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。