Skip to main content
QUICK REVIEW

[論文レビュー] Preference-based Reinforcement Learning with Finite-Time Guarantees

Yichong Xu, Ruosong Wang|arXiv (Cornell University)|Jun 16, 2020
Advanced Bandit Algorithms Research参考文献 37被引用数 7
ひとこと要約

本稿では、ε-最適方策を有限時間で見つける保証を備えた、初めての好みベースの強化学習アルゴリズムであるPEPSを提示する。合成報酬推定、探索のためのデュエルバンディット、ポリシー探索を組み合わせることで、真の報酬にアクセスできない状況でも、隠れた報酬とのリンク関数を介した確率的好みの仮定のもとで、高確率で近似的に最適な方策に収束することが可能である。

ABSTRACT

Preference-based Reinforcement Learning (PbRL) replaces reward values in traditional reinforcement learning by preferences to better elicit human opinion on the target objective, especially when numerical reward values are hard to design or interpret. Despite promising results in applications, the theoretical understanding of PbRL is still in its infancy. In this paper, we present the first finite-time analysis for general PbRL problems. We first show that a unique optimal policy may not exist if preferences over trajectories are deterministic for PbRL. If preferences are stochastic, and the preference probability relates to the hidden reward values, we present algorithms for PbRL, both with and without a simulator, that are able to identify the best policy up to accuracy $\varepsilon$ with high probability. Our method explores the state space by navigating to under-explored states, and solves PbRL using a combination of dueling bandits and policy search. Experiments show the efficacy of our method when it is applied to real-world problems.

研究の動機と目的

  • 好みベースの強化学習(PbRL)における理論的保証の欠如、特に有限時間収束の欠如に取り組む。
  • 数値報酬関数を必要とせずにPbRL設定においてε-最適方策を特定できるアルゴリズムを開発する。
  • 遅いQ値推定や高コストな後方確率サンプリングに依存しないことで、効率性とスケーラビリティを確保する。
  • シミュレータの有無に関わらず適用可能な、一般化されたフレームワークを提供する。
  • DPS や EPMC のような先行手法が示す遅い収束性と劣った探索性能の制限を克服する。

提案手法

  • 好みの確率から推定報酬にマップする合成報酬関数を提案し、直接的な報酬アクセスなしにポリシー最適化を可能にする。
  • 未十分に探索された状態における高報酬行動を特定することで、探索をガイドするデュエルバンディットアルゴリズムを用いる。
  • 好みフィードバックと合成報酬推定の組み合わせを用いてポリシーを反復的に最適化するポリシー探索を適用する。
  • 報酬差の隠れた報酬との関係をモデル化するため、線形好みを一般化したリンク関数仮定を採用する。
  • サンプル制限下でのベースラインとの比較を可能にするために、アルゴリズムの固定予算バージョンを設計する。
  • 到達可能性に基づく状態選択を用いて探索を統合し、高確率状態のカバーを保証する。

実験結果

リサーチクエスチョン

  • RQ1好みが決定的である場合、好みベースの強化学習において一意の最適方策が存在する条件は何か?
  • RQ2数値報酬にアクセスできない状況でも、有限時間でε-最適方策に収束できるか?
  • RQ3遅いQ値推定に依存しない効率的な探索戦略を、PbRLでどのように設計できるか?
  • RQ4好みの確率的性質とリンク関数の構造が、アルゴリズムの性能とサンプル効率に与える影響は何か?
  • RQ5DPS や EPMC といった既存のベースラインを、サンプル効率と方策品質の両面で上回るPbRLアルゴリズムを開発できるか?

主な発見

  • 好みが決定的である場合、推移性が成立しない可能性があり、一意の最適方策は存在しない—これは確率的好み仮定の必要性を強調する。
  • 一般化線形リンク関数仮定のもとで、PEPSは有限時間保証のもとでε-最適方策の高確率回復を達成する。
  • グリッドワールドおよびランダムMDP環境において、PEPSはDPSおよびEPMCを上回り、特にサンプル予算が低い状況や近似的に決定的な好み(c=0.001)の下で顕著な優位性を示す。
  • c=0.001の場合、PEPSはほぼすべての実行で正確な最適方策を回復するが、EPMCは予算の増加に対してもほとんど改善を示さない。
  • PEPSにおけるデュエルバンディットに基づく探索は、DPS や EPMC が遅いQ推定によりほぼランダムに探索するのとは異なり、高到達可能性状態を効果的にカバーする。
  • PEPSは実装が単純であり、既存の価値ベース強化学習およびデュエルバンディット手法をサブルーチンとして容易に統合できる汎用性を持つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。