Skip to main content
QUICK REVIEW

[論文レビュー] APRIL: Active Preference-learning based Reinforcement Learning

Riad Akrour, Marc Schoenauer|arXiv (Cornell University)|Aug 5, 2012
Reinforcement Learning in Robotics参考文献 26被引用数 10
ひとこと要約

APRILは、選択の近似期待効用(AEUS)基準を用いて反復的にポリシーを最適化することで、専門家のフィードバックを最小限に抑える、アクティブな好みベースの強化学習フレームワークを提案する。マウンテンカーやがん治療のタスクにおいて、わずか12回程度の専門家比較でのみ最先端の性能を達成し、IRL や CMA-ES よりも高いサンプル効率を示す。

ABSTRACT

This paper focuses on reinforcement learning (RL) with limited prior knowledge. In the domain of swarm robotics for instance, the expert can hardly design a reward function or demonstrate the target behavior, forbidding the use of both standard RL and inverse reinforcement learning. Although with a limited expertise, the human expert is still often able to emit preferences and rank the agent demonstrations. Earlier work has presented an iterative preference-based RL framework: expert preferences are exploited to learn an approximate policy return, thus enabling the agent to achieve direct policy search. Iteratively, the agent selects a new candidate policy and demonstrates it; the expert ranks the new demonstration comparatively to the previous best one; the expert's ranking feedback enables the agent to refine the approximate policy return, and the process is iterated. In this paper, preference-based reinforcement learning is combined with active ranking in order to decrease the number of ranking queries to the expert needed to yield a satisfactory policy. Experiments on the mountain car and the cancer treatment testbeds witness that a couple of dozen rankings enable to learn a competent policy.

研究の動機と目的

  • 好みベースの強化学習における専門家の順位付けクエリの回数を減らすこと。
  • 報酬関数が利用できない状況や、デモンストレーションが現実的でない状況(特にス warm ロボティクスのような複雑な分野)においても、効果的なポリシー学習を可能にすること。
  • アクティブラーニングと好みベースのポリシー学習を組み合わせ、有効なポリシーに収束するまでの速度を向上させること。
  • 高次元空間におけるパrametricポリシー表現に対する非滑らかなポリシー行動の課題に対処すること。
  • 連続的かつ高次元のポリシー空間におけるベイジアンアクティブラーニングのスケーラブルで実行可能な代替手法を開発すること。

提案手法

  • 好みベースのポリシー学習とアクティブランク付けを組み合わせた、アクティブな好みベースの強化学習(APRIL)アルゴリズムを導入する。
  • 最も情報量の多いポリシーを選択するために、近似期待効用の選択(AEUS)基準を採用する。
  • パラメトリックポリシー空間(最適化用)と行動空間(好みモデリング用)の二空間フレームワークを採用し、非滑らか関数 Φ を介して結びつける。
  • 高次元空間におけるベイジアンスタイルのアクティブラーニングを可能にするために、逆写像 Φ⁻¹ を近似するための実行可能な代替関数を用いる。
  • 専門家のフィードバックを、ポリシー軌道間のペアワイズ比較の形で活用し、ポリシーの報酬推定値を改善する。
  • ベイジアン最適化に類似したアプローチを用い、期待情報量の増加を最大化する新しい候補ポリシーを選択する。

実験結果

リサーチクエスチョン

  • RQ1アクティブな好み学習は、強化学習における有効なポリシーを学習するために必要な専門家の比較回数を削減できるか?
  • RQ2高次元パラメトリックポリシー空間における非滑らかなポリシー行動マッピングに、ベイジアンアクティブラーニングをどのように適合できるか?
  • RQ3数10回程度の専門家比較で、IRL や CMA-ES と同等の性能を達成できるか、その程度はどの程度か?
  • RQ4報酬関数の設計が困難で、デモンストレーションが現実的でない環境において、APRILはどのように動作するか?
  • RQ5AEUSは、複雑なRL設定における正確な選択の期待効用の代替として、実行可能であるか?

主な発見

  • マウンテンカーのタスクにおいて、APRILはわずか15回の専門家比較で最先端の性能を達成し、IRL や CMA-ES を上回った。
  • がん治療のテストベッドにおいて、APRILは20回未満の反復で最適性能に到達したが、CMA-ES は収束しなかった。
  • マウンテンカー環境では、15反復後にIRLの性能と同等またはそれを上回ったが、IRL は専門家のデモンストレーションに依存している。
  • ノイズレベル σ_noise = 0.2 までに耐性を示し、101回の実験で一貫した性能を維持した。
  • AEUS基準により、非アクティブ手法と比較して、必要な専門家クエリ回数を10倍に削減できた。
  • 実験により、報酬形状付けやデモンストレーションがなくても、僅か数10ビットの好みフィードバック(比較)で有効なポリシーを学習可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。