Skip to main content
QUICK REVIEW

[論文レビュー] A Probabilistic Interpretation of Self-Paced Learning with Applications to Reinforcement Learning

Pascal Klink, Hany Abdulsamad|arXiv (Cornell University)|Feb 25, 2021
Reinforcement Learning in Robotics被引用数 9
ひとこと要約

本稿は強化学習(RL)における自己-paced学習(SPL)の確率的解釈を提案し、カリキュラム生成を、タスクの複雑さとターゲットタスク分布のバランスをとる分布からのサンプリングとして定式化する。SPLをRL-as-inferenceフレームワークと統合することで、多様なRL環境におけるスパarsely sparseな報酬設定において、サンプル効率を向上させるとともに、悪い局所最適解を回避する。本手法は、エピソードベースおよびステップベースのRL設定の両方で、最先端のカリキュラム手法を上回る性能を示した。

ABSTRACT

Across machine learning, the use of curricula has shown strong empirical potential to improve learning from data by avoiding local optima of training objectives. For reinforcement learning (RL), curricula are especially interesting, as the underlying optimization has a strong tendency to get stuck in local optima due to the exploration-exploitation trade-off. Recently, a number of approaches for an automatic generation of curricula for RL have been shown to increase performance while requiring less expert knowledge compared to manually designed curricula. However, these approaches are seldomly investigated from a theoretical perspective, preventing a deeper understanding of their mechanics. In this paper, we present an approach for automated curriculum generation in RL with a clear theoretical underpinning. More precisely, we formalize the well-known self-paced learning paradigm as inducing a distribution over training tasks, which trades off between task complexity and the objective to match a desired task distribution. Experiments show that training on this induced distribution helps to avoid poor local optima across RL algorithms in different tasks with uninformative rewards and challenging exploration requirements.

研究の動機と目的

  • RLにおける自動カリキュラム学習(CL)は、実験的成果は挙げているが、理論的根拠に欠けるという問題に対処する。
  • 自己-paced学習(SPL)を、訓練タスクの上に分布を誘導する確率的サンプリング機構として形式化し、カリキュラム生成をガイドする。
  • SPLをRL-as-inferenceフレームワークと統合することで、文脈付きRLにおける原理的カリキュラム誘導を可能にする。
  • スパarsely sparseな報酬と高い探索要件を伴う挑戦的なRL環境において、学習効率とロバスト性を向上させる。
  • 複数のRLアルゴリズムと環境において、既存のCL手法を上回る性能を示す。

提案手法

  • 自己-paced学習を、訓練タスク上に分布を誘導するものとして再定式化し、サンプル重みをサンプリング確率に対応させる。
  • エージェントの価値関数(タスクの難易度)を最小化することと、ターゲットタスク分布へのKLダイバージェンスを最小化することの両方をトレードオフにする共同目的関数を定義する。
  • RL-as-inferenceのパラダイムを活用し、変分推論の目的関数を導出し、SPLを確立された正則化技術と結びつける。
  • 温度付き推論を用いて訓練を安定化させ、簡単なタスクから難しいタスクへ滑らかにカリキュラムを進行可能にする。
  • 推定された難易度と分布の整合性に基づき、動的にタスクの重みを再設定することでカリキュラムを実装する。
  • ベースとなるアルゴリズムとしてPPO、SAC、TRPOを用い、エピソードベースおよびステップベースのRL設定の両方で本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1自己-paced学習は、RLにおける確率的枠組み内でどのように形式的に解釈できるか?
  • RQ2分布ベースのカリキュラム生成手法は、報酬がスパarsely sparseなRLにおいて、サンプル効率と一般化性能を向上させることができるか?
  • RQ3本手法は、既存の自動カリキュラム学習アプローチと比較して、性能とロバスト性の面で優れているか?
  • RQ4タスクの複雑さとターゲット分布マッチングのバランスが、RLにおける悪い局所最適解の回避に与える影響は何か?
  • RQ5本手法は、アーキテクチャの変更なしに、標準的なRLアルゴリズムに効果的に統合できるか?

主な発見

  • 提案された確率的SPLフレームワークは、報酬がスパarsely sparseな環境において、複数のRLアルゴリズム(PPO、SAC、TRPO)で学習性能を顕著に向上させた。
  • アンチゲート環境では、SACを用いてSPDLが0.75のキャッチレートを達成し、GoalGAN(0.50)とALP-GMM(0.25)を上回り、最先端のCL手法と同等またはそれを上回った。
  • ボールキャッチ環境では、PPOを用いてSPDLが平均0.75のキャッチレートを達成し、ベースライン手法と比較して優れた信頼性と方向性のある行動を示した。
  • SPDLで訓練されたポリシーは、より一貫性があり、目的指向の行動を示した。一方、ターゲットタスクに直接訓練した場合に観察された無行動ポリシーを回避した。
  • 難易度の高いタスクを段階的に導入することで、悪い局所最適解を効果的に回避した。これは、訓練の各ステージで安定的かつ高い報酬蓄積が得られたことで裏付けられた。
  • SPLとRL-as-inferenceの統合により、理論的根拠に基づいたカリキュラム学習のメカニズムが得られ、一般化性能とサンプル効率の両方が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。