[論文レビュー] Generating Automatic Curricula via Self-Supervised Active Domain Randomization
本論文では、自己プレイを用いて自己教師付き報酬信号を生成することで、目的空間と環境空間の両方でカリキュラムを共進化させる自己教師付きアクティブドメインランダマイゼーション(SS-ADR)を提案する。より困難なタスクとランダム化された環境を同時に最適化することで、複数のロボットタスクにおいて、低いばらつきで最先端のゼロショット sim2real 移行性能を達成する。
Goal-directed Reinforcement Learning (RL) traditionally considers an agent interacting with an environment, prescribing a real-valued reward to an agent proportional to the completion of some goal. Goal-directed RL has seen large gains in sample efficiency, due to the ease of reusing or generating new experience by proposing goals. One approach,self-play, allows an agent to "play" against itself by alternatively setting and accomplishing goals, creating a learned curriculum through which an agent can learn to accomplish progressively more difficult goals. However, self-play has been limited to goal curriculum learning or learning progressively harder goals within a single environment. Recent work on robotic agents has shown that varying the environment during training, for example with domain randomization, leads to more robust transfer. As a result, we extend the self-play framework to jointly learn a goal and environment curriculum, leading to an approach that learns the most fruitful domain randomization strategy with self-play. Our method, Self-Supervised Active Domain Randomization(SS-ADR), generates a coupled goal-task curriculum, where agents learn through progressively more difficult tasks and environment variations. By encouraging the agent to try tasks that are just outside of its current capabilities, SS-ADR builds a domain randomization curriculum that enables state-of-the-art results on varioussim2real transfer tasks. Our results show that a curriculum of co-evolving the environment difficulty together with the difficulty of goals set in each environment provides practical benefits in the goal-directed tasks tested.
研究の動機と目的
- 外部報酬を自己教師付き内発的信号に置き換えることで、目的指向強化学習における報酬設計とカリキュラム設計の課題に取り組む。
- 従来のカリキュラム学習やドメインランダマイゼーションの限界を克服するため、目的と環境変動空間の両方を同時に最適化する。
- エージェントの現在の能力に適応するカリキュラムを学習することで、ロボット強化学習における頑健な sim2real 移行を実現し、リアリティギャップを低減する。
- ランダマイゼーション範囲の手動チューニングを排除し、アクティブな探索を通じてカリキュラムが自己補正できるようにする。
- 最適なタスク難易度と環境多様性を同時に学習する二段階最適化フレームワークを構築し、ポリシーの一般化を向上させる。
提案手法
- 問題を二段階最適化として定式化する:内側のループでは、与えられた環境-目的ペアに対するポリシー性能を最適化し、外側のループでは自己プレイに基づく指標を最大化することでカリキュラムの進行をガイドする。
- 2つのエージェント(アリスとボブ)間の非対称な自己プレイを用い、相対的パフォーマンスに基づく自己教師付き報酬信号を生成することで、次第に難易度が上がるタスクの探索を促進する。
- アクティブドメインランダマイゼーション(ADR)を自己プレイと統合し、最も情報の多い環境変化を動的にサンプリングすることで、生産性が低いか、不安定な設定を回避する。
- 自己プレイの結果から得られる1つの自己教師付き報酬信号を活用し、目的と環境のカリキュラム進化を同時にガイドすることで、外部報酬形状の必要性を排除する。
- 高次元で連続的な行動空間において安定した学習を可能にするために、SVPG(価値政策勾配を伴うソフトアクタクリティック)をポリシー最適化に適用する。
- アルゴリズムが物理的に不安定または解けない環境(例:ランダマイゼーション係数が0.05未満のもの)を避けることで自己補正を実装し、トレーニング中にランダマイゼーション範囲を適応的に調整する。
実験結果
リサーチクエスチョン
- RQ1自己プレイから得られる自己教師付き報酬信号は、目的指向強化学習における目的空間と環境空間の両方のカリキュラム学習を効果的にガイドできるか?
- RQ2環境と目的の難易度を同時に進化させることで、静的または独立して最適化されたカリキュラムと比較して、ポリシーの頑健性と sim2real 移行性能が向上するか?
- RQ3ランダマイゼーション範囲の手動チューニングなしに、生産性が低いか不安定な環境設定を回避できるか?
- RQ4トレーニングの安定性、収束速度、ゼロショット移行性能の観点から、SS-ADRは標準的なドメインランダマイゼーションやアクティブドメインランダマイゼーションと比較してどのように異なるか?
- RQ5共同カリキュラム学習フレームワークは、多様な現実世界の環境におけるポリシー性能のばらつきをどの程度低減できるか?
主な発見
- SS-ADRは、テストされたすべてのロボットタスクで、シミュレーション環境および現実世界環境において、すべてのベースラインを上回る最先端のゼロショット sim2real 移行性能を達成する。
- 標準的なドメインランダマイゼーションやアクティブドメインランダマイゼーションと比較して、トレーニングのばらつきが顕著に低減され、より安定したポリシー学習が実現されている。
- 補正されていないランダマイゼーション範囲では、SS-ADRは物理的に不安定な環境(例:ランダマイゼーション係数が0.05未満のもの)を効果的に回避するが、UDR(一様ドメインランダマイゼーション)はこれらの領域を回避できない。
- 補正された範囲では、SS-ADRはUDRよりもより効果的なカリキュラムを学習する。特に、難易度の高いタスク領域に集中してサンプリングする傾向が見られ、より優れたカリキュラム進化が示された。
- 自己プレイの結果から得られる自己教師付き報酬は、外部報酬形状なしに効果的なカリキュラム進化を可能にし、複雑なタスク空間における内発的で自己駆動型の学習の可能性を示した。
- 二段階最適化フレームワークは、目的と環境のカリキュラムを効果的に共進化させ、微調整を最小限に抑えても複数の現実世界設定に一般化可能なポリシーを生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。