Skip to main content
QUICK REVIEW

[論文レビュー] Robust Visual Domain Randomization for Reinforcement Learning

Reda Bahi Slaoui, William R. Clements|arXiv (Cornell University)|Oct 23, 2019
Domain Adaptation and Few-Shot Learning参考文献 36被引用数 7
ひとこと要約

本論文は、1つの環境バリエーションでのエージェント学習を促進しつつ、視覚的ドメインランダマイゼーションにわたる状態表現の不変性を強制する正則化手法を提案する。同じ状態の異なる視覚的ランダマイゼーション下での特徴量のL2距離を最小化することで、標準的なドメインランダマイゼーションと比較して優れたロバストネスとサンプル効率を達成し、未観測の視覚ドメインにおいて同等またはそれ以上の一般化性能を維持する。

ABSTRACT

Producing agents that can generalize to a wide range of visually different environments is a significant challenge in reinforcement learning. One method for overcoming this issue is visual domain randomization, whereby at the start of each training episode some visual aspects of the environment are randomized so that the agent is exposed to many possible variations. However, domain randomization is highly inefficient and may lead to policies with high variance across domains. Instead, we propose a regularization method whereby the agent is only trained on one variation of the environment, and its learned state representations are regularized during training to be invariant across domains. We conduct experiments that demonstrate that our technique leads to more efficient and robust learning than standard domain randomization, while achieving equal generalization scores.

研究の動機と目的

  • 強化学習における標準的な視覚的ドメインランダマイゼーションの非効率性と高い分散を是正すること。
  • 現実世界のデータを必要とせずに、未観測の視覚ドメインへの一般化を向上させること。
  • 訓練中に特定の視覚環境に過剰に適合するのを防ぐこと。
  • 視覚的ドメインシフトにわたる不変な状態表現を正則化する手法を開発すること。
  • 中間層における不変性の理論的および実験的妥当性を提示すること。

提案手法

  • エージェントは、固定された視覚的性質(例えば、特定の背景色)を持つ参照環境でのみ訓練される。
  • 訓練中、同じ状態の異なる視覚的ランダマイゼーション下での特徴表現の差異をペナルティ化する正則化項が適用される。
  • 正則化は、ポリシー出力ではなくニューラルネットワークの中間層に適用され、不変な状態表現の促進を図る。
  • 二重入力の順伝播を用いる:1つは参照環境、もう1つは同じ状態のランダムに選択された視覚的バリエーション。
  • 損失関数は、標準的なRL損失(例:Q学習やポリシー勾配)と、特徴量間のL2距離に基づく対照的正則化項を組み合わせる。
  • 本手法は、価値ベース(例:DQN)およびポリシー勾配(例:PPO)の両方のRLアルゴリズムと互換性を持つ。

実験結果

リサーチクエスチョン

  • RQ1中間状態表現の正則化は、サンプル複雑性を増加させることなく、視覚的ドメインランダマイゼーションにおける一般化を改善できるか?
  • RQ2特徴表現における不変性は、未観測の視覚的ドメインシフトにわたるポリシーのロバストネスにどのように影響するか?
  • RQ3中間層への正則化は、ポリシー出力への正則化や入力摂動への正則化を上回るか?
  • RQ4本手法は、標準的なドメインランダマイゼーションと比較して、訓練効率および性能の分散の面で優れているか?
  • RQ5t-SNEによる表現の可視化で測定した特徴空間構造に、正則化がどのように影響を与えるか?

主な発見

  • 正則化されたエージェントは、標準的なドメインランダマイゼーションと同等の一般化性能を達成するが、異なる視覚ドメインにおける分散が著しく低い。
  • t-SNEの可視化から、正則化されたエージェントは多様な視覚ドメインに対して類似した表現を学習している一方、ランダマイズドエージェントは異なるドメインに対して異なる表現を学習していることが示された。
  • 正則化されたエージェントは、訓練データに含まれない背景色などの未観測の視覚ランダマイゼーションに対しても、ロバストに一般化するが、ランダマイズドエージェントは特徴表現の分散が著しく高い。
  • 特定の視覚設定への過剰適合が抑制されており、広範な背景色の範囲にわたり一貫したパフォーマンスが得られていることから、その兆候が示された。
  • 正則化により訓練がより効率的になり、エージェントがロールアウト中にすべての視覚的バリエーションを経験する必要がなくなった。
  • 理論的分析により、本手法による正則化が、視覚的ランダマイゼーションにわたるポリシーのリプシッツ連続性を向上させ、ロバストネスを強化することが支持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。