[論文レビュー] Curriculum Reinforcement Learning using Optimal Transport via Gradual Domain Adaptation
本稿では、Wasserstein重心を用いてタスク分布の補間を最適輸送問題として定式化することで、ソースタスクからターゲットタスクへの滑らかで段階的なポリシー移行を可能にする、curriculum強化学習フレームワークGRADIENTを提案する。タスクに依存する文脈的距離尺度を活用し、離散的および連続的文脈の両方を処理することで、走行および操作タスクにおいてSOTAベースラインと比較して優れた学習効率と漸近的性能を達成する。
Curriculum Reinforcement Learning (CRL) aims to create a sequence of tasks, starting from easy ones and gradually learning towards difficult tasks. In this work, we focus on the idea of framing CRL as interpolations between a source (auxiliary) and a target task distribution. Although existing studies have shown the great potential of this idea, it remains unclear how to formally quantify and generate the movement between task distributions. Inspired by the insights from gradual domain adaptation in semi-supervised learning, we create a natural curriculum by breaking down the potentially large task distributional shift in CRL into smaller shifts. We propose GRADIENT, which formulates CRL as an optimal transport problem with a tailored distance metric between tasks. Specifically, we generate a sequence of task distributions as a geodesic interpolation (i.e., Wasserstein barycenter) between the source and target distributions. Different from many existing methods, our algorithm considers a task-dependent contextual distance metric and is capable of handling nonparametric distributions in both continuous and discrete context settings. In addition, we theoretically show that GRADIENT enables smooth transfer between subsequent stages in the curriculum under certain conditions. We conduct extensive experiments in locomotion and manipulation tasks and show that our proposed GRADIENT achieves higher performance than baselines in terms of learning efficiency and asymptotic performance.
研究の動機と目的
- 大規模な分布シフトを回避し、より小さな移行に分解することで、curriculum強化学習(CRL)における課題に取り組む。
- 最適輸送理論を用いて、ソースおよびターゲットタスク分布間の地図的補間としてcurriculum生成を形式化する。
- パrametricな分布仮定を必要とせず、非パラメトリックで連続的および離散的文脈空間を扱える手法を開発する。
- 理論的保証を用いて、curriculum段階間での滑らかなポリシー移行を保証する。
- ナビゲーションや操作といった複雑なRLタスクにおける学習効率および漸近的性能を向上させる。
提案手法
- ソースとターゲット間の中間タスク分布を生成するために、Wasserstein重心を用いてCRLを最適輸送問題として定式化する。
- 推定されたリターン差の基盤に基づき、$ d^\pi(c_i, c_j) = |J^\pi(c_i) - J^\pi(c_j)| $ というタスク依存の文脈的距離尺度 $ d^\pi(c_i, c_j) $ を導入し、タスクの類似度を反映する。
- 自己符号化器を用いて学習された埋め込み空間を活用し、ユークリッド距離がWasserstein距離を近似するように文脈を潜在空間にマップすることで、自由サポート設定における補間を可能にする。
- 二段階のアルゴリズムを採用する:第一に、収集された軌道からガウス過程回帰を用いてポリシー価値関数 $ J^\pi(c) $ を推定する。第二に、文脈的距離尺度を埋め込むためのエンコーダ・デコーダネットワークを訓練する。
- 増加する $ \alpha \in [0,1] $ を用いて段階的補間を実行し、ソースとターゲット間のbarycenterとしてタスク分布の系列を生成する。
- エージェントが各補間された分布で訓練された後、ポリシーを更新し距離尺度を精緻化するcurriculumループを採用する。
実験結果
リサーチクエスチョン
- RQ1最適輸送を用いることで、ソースとターゲットタスク分布の間の補間を通じて、自然で段階的なcurriculumを有効に生成できるか?
- RQ2連続的および離散的設定の両方において、タスクの難易度差を反映するタスク依存の文脈的意味のある距離尺度をどのように定義できるか?
- RQ3提案手法は、連続するcurriculum段階間での滑らかなポリシー移行を保証できるか?その保証が成立する条件は何か?
- RQ4学習済み埋め込みを用いたWasserstein重心補間は、線形補間および既存のCRLベースラインと比較して、学習効率および最終的性能で優れているか?
- RQ5パラメトリックな形を仮定しない非パラメトリックおよび暗黙のタスク分布を、本手法はどのように処理できるか?
主な発見
- GRADIENTは、走行および操作タスクにおいてSOTAのCRLベースラインと比較して、より高い学習効率を達成し、収束が速い。
- 本手法は、U字型迷路のような複雑な環境において、より優れた漸近的性能を示し、高い最終リターンを達成する。
- 障害物付きのU字型迷路では、線形補間の欠陥を回避し、中間の非ゼロ確率の開始位置をカバーする。
- 理論的分析により、特定の条件下ではGRADIENTがcurriculum段階間での滑らかなポリシー移行を保証し、性能低下を最小限に抑えることが示された。
- 学習済み距離埋め込みの使用により、$ l_2 $ 距離が構造的タスク差を捉えられない自由サポートの連続的文脈空間でも、効果的な補間が可能である。
- 実験的結果から、ポリシーが段階を経て向上するにつれ、補間されたタスク分布の質も向上し、全体的なcurriculum進行が改善することが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。