Skip to main content
QUICK REVIEW

[論文レビュー] Sample-Efficient Multi-Objective Learning via Generalized Policy Improvement Prioritization

Lucas N. Alegre, Ana L. C. Bazzan|arXiv (Cornell University)|Jan 18, 2023
Domain Adaptation and Few-Shot Learning被引用数 7
ひとこと要約

本論文は、一般化政策改善(GPI)を活用して学習目的と経験リプレイの優先順位を付けることで、逐次的改善を保証し、最適解またはε-最適解への収束を達成する、サンプル効率の高いモデルベース多目的強化学習(MORL)アルゴリズムを提案する。GPI理論に基づいた形式的導出による優先順位付けスキームを用いることで、離散的および連続的制御タスクの両方で最先端の手法を上回る性能を達成している。

ABSTRACT

Multi-objective reinforcement learning (MORL) algorithms tackle sequential decision problems where agents may have different preferences over (possibly conflicting) reward functions. Such algorithms often learn a set of policies (each optimized for a particular agent preference) that can later be used to solve problems with novel preferences. We introduce a novel algorithm that uses Generalized Policy Improvement (GPI) to define principled, formally-derived prioritization schemes that improve sample-efficient learning. They implement active-learning strategies by which the agent can (i) identify the most promising preferences/objectives to train on at each moment, to more rapidly solve a given MORL problem; and (ii) identify which previous experiences are most relevant when learning a policy for a particular agent preference, via a novel Dyna-style MORL method. We prove our algorithm is guaranteed to always converge to an optimal solution in a finite number of steps, or an $ε$-optimal solution (for a bounded $ε$) if the agent is limited and can only identify possibly sub-optimal policies. We also prove that our method monotonically improves the quality of its partial solutions while learning. Finally, we introduce a bound that characterizes the maximum utility loss (with respect to the optimal solution) incurred by the partial solutions computed by our method throughout learning. We empirically show that our method outperforms state-of-the-art MORL algorithms in challenging multi-objective tasks, both with discrete and continuous state and action spaces.

研究の動機と目的

  • 複数の目的間のトレードオフを学習する際、異なる重み設定に対する複数のポリシーを学習するために膨大な環境インタラクションが必要となる多目的強化学習(MORL)におけるサンプル非効率性を是正すること。
  • 各学習ステップでどの重み設定のポリシーを学習するかを、原理的かつ形式的根拠に基づいて選択する手法を開発し、収束速度と解の品質を向上させること。
  • 過去の経験を、計画に最も関連性の高いものに特定することで、効率的な再利用を可能にする、新規なダイナスタイルMORLアプローチを提供すること。
  • 部分的解の逐次的改善を保証するとともに、学習中における効用損失の理論的上限を提供すること。
  • 従来のテーブル型または離散的設定に限られていたモデルベースMORLを、連続的状態空間および行動空間へと拡張すること。

提案手法

  • アルゴリズムは一般化政策改善(GPI)を用いて、各候補となる重みベクトルに対する性能向上の下界を導出し、学習に最も有望な目的を優先順位付けできるようにする。
  • 過去の経験を、特定の重み設定のポリシー向上に寄与する可能性の高いものに基づいて選択的に再利用する、ダイナスタイルの計画メカニズムを導入する。
  • ポリシーの凸被覆集合(CCS)を維持し、段階的に改善することで、ポリシーが部分的に最適でない場合でも逐次的改善を保証する。
  • 各学習反復において、部分的解の最大効用損失を形式的に境界づけることで、学習中の解の品質に対する理論的保証を提供する。
  • アルゴリズムは、いつでも有効な解を返せる「いつでもアルゴリズム」として設計されており、学習の途中でも継続的に改善を続ける。
  • 連続的状態空間および行動空間をサポートしており、テーブル型や離散的設定にとどまらない、現実世界の複雑な環境への適用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1GPIに基づく重み設定の優先順位付けスキームは、MORLにおける収束速度の向上とサンプル効率の向上をもたらすか?
  • RQ2過去の経験を効果的に再利用するダイナスタイルの計画メカニズムは、特定のエージェントの好みに適合したポリシー学習を加速するか?
  • RQ3提案手法は、ポリシーが部分的に最適でない場合でも、部分的解の逐次的改善を保証するか?
  • RQ4この手法は、学習プロセス全体を通じて一時的解が被る最大効用損失に対して形式的境界を提供できるか?
  • RQ5連続的状態空間および行動空間へと拡張された場合でも、理論的保証とサンプル効率を維持できるか?

主な発見

  • 提案手法は、離散的および連続的制御タスクの両方で最先端のMORLアルゴリズムを上回り、環境インタラクション回数を減らしても優れた性能を達成している。
  • 連続的制御ベンチマークにおいて、本手法は、競合する進化的アルゴリズムの環境インタラクション予算の10分の1しか使用しなかったにもかかわらず、それを上回った。
  • アルゴリズムは有限ステップ内で最適解への収束を保証する。リソース制約下ではε-最適解への収束を保証し、効用損失が有界である。
  • 学習の全過程にわたり、凸被覆集合(CCS)の品質が逐次的に向上し、中間段階のポリシーが部分的に最適でない場合でも同様に成立する。
  • 効用損失の理論的境界により、各反復で解の品質を形式的に測定でき、信頼性の高い進行状況のモニタリングが可能である。
  • GPIに基づく優先順位付けスキームは、ヒューリスティック手法(例:OLS)を上回り、計算の無駄を減らすために、高い影響を持つ重み設定をより正確に特定できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。