[論文レビュー] Cross-Trajectory Representation Learning for Zero-Shot Generalization in RL
本稿では、報酬信号に依存せずに行動的に類似した軌道を類似した潜在表現にマッピングするようにエンコーダーを訓練することにより、ゼロショット一般化を向上させる自己教師あり表現学習手法であるCross-Trajectory Representation Learning (CTRL) を提案する。CTRLは、エージェント自身のポリシーから得られる軌道表現に対してクラスタリングベースの対照的目的関数を用い、PPOと組み合わせることでProcgenベンチマークで最先端の性能を達成し、エンドツーエンドRLおよび他の自己教師あり手法を上回る。
A highly desirable property of a reinforcement learning (RL) agent -- and a major difficulty for deep RL approaches -- is the ability to generalize policies learned on a few tasks over a high-dimensional observation space to similar tasks not seen during training. Many promising approaches to this challenge consider RL as a process of training two functions simultaneously: a complex nonlinear encoder that maps high-dimensional observations to a latent representation space, and a simple linear policy over this space. We posit that a superior encoder for zero-shot generalization in RL can be trained by using solely an auxiliary SSL objective if the training process encourages the encoder to map behaviorally similar observations to similar representations, as reward-based signal can cause overfitting in the encoder (Raileanu et al., 2021). We propose Cross-Trajectory Representation Learning (CTRL), a method that runs within an RL agent and conditions its encoder to recognize behavioral similarity in observations by applying a novel SSL objective to pairs of trajectories from the agent's policies. CTRL can be viewed as having the same effect as inducing a pseudo-bisimulation metric but, crucially, avoids the use of rewards and associated overfitting risks. Our experiments ablate various components of CTRL and demonstrate that in combination with PPO it achieves better generalization performance on the challenging Procgen benchmark suite (Cobbe et al., 2020).
研究の動機と目的
- 高次元の観測空間における深層強化学習におけるゼロショット一般化を向上させること。特に、未観測だが類似したタスク間での一般化が重要である。
- 報酬依存の教師信号による表現学習の過学習リスクを軽減するため、報酬に依存しない行動的根拠に基づく自己教師あり目的関数に置き換えること。
- 外部の教師信号や事前定義されたポリシー類似性メトリクスを必要とせずに、軌道間の行動的類似性を捉える表現学習手法を開発すること。
- 未教師ありの軌道レベルの行動的類似性の学習が、従来の対照的または内因的好奇心ベースの手法よりも優れた一般化をもたらすことを実証すること。
提案手法
- CTRLは、エージェント自身のポリシーから収集した軌道表現に、自己教師ありの対照的目的関数を適用することで、ニューラルエンコーダーを訓練する。
- 行動的類似性に基づいて、軌道表現を動的プロトタイプにグループ化するオンラインクラスタリングを用い、対照的学習のためのポジティブペアを形成する。
- 近接するクラスタ間の表現に対して、クロス予測損失を適用することで、行動的に類似した軌道の整合的で低次元の表現を学習する。
- 標準的な強化学習フレームワーク(例:PPO)内で動作させ、主なRL目的を変更せずに、ポリシー最適化中に対照的目的関数を適用することで表現品質を向上させる。
- CTRLは信念状態上に擬似双模倣メトリクスを暗黙的に学習し、形式的な双模倣と整合性を持つが、報酬依存性や関連する過学習を回避する。
- 本手法はモジュラーであり、オフポリシーまたはオンポリシーの任意のRLアルゴリズムと組み合わせ可能であり、Procgenベンチマークスイートを用いた実証的検証が行われている。
実験結果
リサーチクエスチョン
- RQ1報酬信号に依存せずに、軌道の対照的自己教師あり目的関数が、深層強化学習におけるゼロショット一般化を向上させることができるか?
- RQ2軌道間の行動的類似性を学習することで、DIAYN や Proto-RL などの既存の表現学習手法よりも優れた一般化が達成できるか?
- RQ3軌道表現のクラスタリングにおける時間的ダイナミクスが、ゼロショットRL設定における一般化性能に与える影響は何か?
- RQ4報酬に依存しない行動的根拠に基づく表現学習手法が、PSE や DBC のような報酬ベースまたはメトリクスベースのアプローチと同等またはそれ以上の性能を達成できるか?
主な発見
- PPOと組み合わせたCTRLは、Procgenベンチマークでゼロショット一般化性能において最先端を記録し、DAAC、PPO+DIAYN、Proto-RLをすべての環境で上回った。
- 平均して、PPO+CTRLはProcgenの全環境で平均報酬6.1を達成し、PPO+DAAC(平均5.2)およびPPO+Proto-RL(平均5.5)を顕著に上回った。
- アブレーションスタディの結果、遅いクラスタリング収束がより良い一般化をもたらすことが示され、表現学習における時間的ダイナミクスがZSGにとって重要であることがわかった。
- PSE や DBC ですら使用するポリシー類似性メトリクスに比べ、CTRLはより優れた性能を示した。これは、この文脈では、暗黙的で軌道ベースの類似性学習が、明示的なメトリクスベースのアプローチよりも効果的であることを示唆している。
- 背景の変化や未観測のタスクダイナミクスに対してもロバストであり、特に『heist』、『plunder』、『fruitbot』のような難易度の高い環境でも高い性能を示した。
- トゥイ環境では、CTRLが局所的な行動的変化を正しく捉えており、報酬の教師信号なしに、微細な行動的類似性を学習できることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。