Skip to main content
QUICK REVIEW

[論文レビュー] Decoupling Value and Policy for Generalization in Reinforcement Learning

Roberta Răileanu, Rob Fergus|arXiv (Cornell University)|Feb 20, 2021
Reinforcement Learning in Robotics参考文献 52被引用数 4
ひとこと要約

本稿では、分離されたネットワークを用いて方策と価値関数の学習を分離し、タスクに無関係な視覚的特徴に対して不変性を強制する、新たな強化学習手法IDAACを提案する。ポリシーと価値関数の表現の非対称性—価値推定には個別的な詳細が必要だが、ポリシーの一般化には不要—を解決することで、プロシージャルに生成された環境のベンチマークであるProcgenおよびDeepMind Controlで、限られた訓練レベルでの状態を達成する一般化性能を実現した。

ABSTRACT

Standard deep reinforcement learning algorithms use a shared representation for the policy and value function, especially when training directly from images. However, we argue that more information is needed to accurately estimate the value function than to learn the optimal policy. Consequently, the use of a shared representation for the policy and value function can lead to overfitting. To alleviate this problem, we propose two approaches which are combined to create IDAAC: Invariant Decoupled Advantage Actor-Critic. First, IDAAC decouples the optimization of the policy and value function, using separate networks to model them. Second, it introduces an auxiliary loss which encourages the representation to be invariant to task-irrelevant properties of the environment. IDAAC shows good generalization to unseen environments, achieving a new state-of-the-art on the Procgen benchmark and outperforming popular methods on DeepMind Control tasks with distractors. Our implementation is available at https://github.com/rraileanu/idaac.

研究の動機と目的

  • 手続き的に生成された環境で限られたインスタンスでの学習における一般化性能の悪さを是正すること。
  • 価値推定に必要な個別的特徴(最適方策学習に不要)とポリシー一般化のための特徴の間で生じるポリシー-価値表現の非対称性を特定・解消すること。
  • 方策と価値関数の最適化を分離し、タスクに無関係な視覚的変化に対して不変性を強制することで、一般化性能を向上させること。
  • 最小限の訓練データでProcgenおよびDeepMind Controlベンチマークで最先端の性能を達成すること。

提案手法

  • 方策と価値関数を別々のニューラルネットワークで実装することで、誤った相関関係を符号化する可能性のある共有表現を回避する。
  • タスクに無関係な視覚的変化(背景色やパターンなど)に対して共有表現が不変であるよう促す補助損失を導入する。
  • 対照的学習を用いて、視覚的摂動(例:背景の入れ替え)に対して表現の変化を最小限に抑えつつ、タスクに関連する状態情報は保持する。
  • 標準的なアドバンテージアクタークリティックの目的関数に従い、方策と価値ネットワークを同時に学習するが、バックプロパゲーションを分離することで干渉を低減する。
  • ドーバーを含むProcgenおよびDeepMind Control環境で評価し、背景変更における特徴ノルム、価値/アドバンテージ差、方策の乖離度といった指標を用いる。
  • 200レベルでのみ学習を行うことで、低データ一般化シナリオに適したモデルを構築する。

実験結果

リサーチクエスチョン

  • RQ1方策と価値関数が単一の表現を共有することで、手続き的に生成された環境で過学習が生じるか?
  • RQ2方策と価値学習の分離により、未観測のレベルへの一般化性能が向上するか?
  • RQ3背景などのタスクに無関係な視覚的特徴に対して不変性を強制することで、耐性および一般化性能が向上するか?
  • RQ4低データおよびドーバーが豊富な環境において、IDAACはPPO や PPG といった最先端手法と比較してどのように性能を発揮するか?
  • RQ5補助的な対照的損失を用いて、表現の不変性を有効に学習できるか、かつ方策性能に悪影響を及げないか?

主な発見

  • IDAACはProcgenベンチマークで最先端の性能を達成し、200レベルでのみ学習したにもかかわらず、先行手法を上回った。
  • 背景変更に対する耐性が著しく向上した:PPO や PPG よりも表現ノルムおよび価値/アドバンテージ差が低く、不要な視覚的特徴への感受性が低いことを示した。
  • 同じ観測の10種類の背景バージョン間でL1およびL2ノルム差が小さいことから、IDAACは背景変更に対して不変な表現を学習した。
  • Jensen-Shannonダイバージェンスで測定した方策の耐性は、ベースラインと同等またはそれ以上であり、一部の環境では行動の等価性があるためJSDが完璧な指標ではないが、依然として優れた性能を示した。
  • PPO-200 や PPG と比較して、IDAACははるかに少ないデータ(10kレベルで学習したPPO-10kでさえも、IDAACに劣る耐性指標を示したが)で優れた一般化性能を達成した。これは、IDAACが極めて少ないデータで高い一般化性能を実現できることを示している。
  • 補助的な不変性損失により、価値推定におけるレベル固有の特徴の記憶が効果的に低減されたが、方策性能に悪影響は及ばなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。