Skip to main content
QUICK REVIEW

[論文レビュー] Dueling Posterior Sampling for Preference-Based Reinforcement Learning

Ellen Novoseller, Yibing Wei|arXiv (Cornell University)|Aug 4, 2019
Advanced Bandit Algorithms Research参考文献 62被引用数 6
ひとこと要約

本稿では、状態行動報酬モデルによる責任割り当てと事後サンプリングを組み合わせることで、軌道レベルの相対的好みのフィードバックから学習するベイジアン強化学習アルゴリズムであるDueling Posterior Sampling (DPS) を提案する。本手法は、好みベースの強化学習における最初の理論的レグレット保証を達成し、ベイジアン線形回帰による責任割り当てモデルを用いて、漸近的にベイジアンノーレグレット収束を示した。

ABSTRACT

In preference-based reinforcement learning (RL), an agent interacts with the environment while receiving preferences instead of absolute feedback. While there is increasing research activity in preference-based RL, the design of formal frameworks that admit tractable theoretical analysis remains an open challenge. Building upon ideas from preference-based bandit learning and posterior sampling in RL, we present DUELING POSTERIOR SAMPLING (DPS), which employs preference-based posterior sampling to learn both the system dynamics and the underlying utility function that governs the preference feedback. As preference feedback is provided on trajectories rather than individual state-action pairs, we develop a Bayesian approach for the credit assignment problem, translating preferences to a posterior distribution over state-action reward models. We prove an asymptotic Bayesian no-regret rate for DPS with a Bayesian linear regression credit assignment model. This is the first regret guarantee for preference-based RL to our knowledge. We also discuss possible avenues for extending the proof methodology to other credit assignment models. Finally, we evaluate the approach empirically, showing competitive performance against existing baselines.

研究の動機と目的

  • 絶対的報酬が利用できない状況における、疎で相対的な好みのフィードバックからの学習という課題に対処すること。
  • ペアワイズの軌道好みから、環境のダイナミクスと潜在的報酬関数を同時に学習できる、実行可能なベイジアンフレームワークの構築。
  • 時間的責任割り当て問題を、軌道レベルの好みを状態行動報酬モデルにマッピングすることで解決すること。
  • 好みベースの強化学習アルゴリズムに対して、最初の理論的レグレット解析を提供し、漸近的ノーレグレット収束を確立すること。
  • 複数の環境においてDPSを実証的に検証し、責任割り当てモデルおよびハイパーパrameterの選択に対して頑健であることを示すこと。

提案手法

  • DPSは、1エピソードあたり2つの独立した軌道を生成する事後サンプリングを用い、ペアワイズ比較による好みベースの学習を可能にする。
  • 状態行動報酬モデルのベイジアン事後分布を維持し、好みのフィードバックを用いて、どの行動や状態が望ましい結果に寄与しているかに関する信念を更新する。
  • 責任割り当てモデルとして、具体的にはベイジアン線形回帰またはガウス過程回帰を用い、軌道レベルの好みを各状態行動ごとの報酬推定値に変換する。
  • 情報理論的技術を統合してベイジアンレグレットをバウンディングし、学習収束の理論的分析を可能にする。
  • 好みのフィードバックは、2つの軌道の累積報酬差の確率的関数としてモデル化され、ノイズはロジスティック関数またはガウス過程を介してモデル化される。
  • 責任割り当てモデルのハイパーパrameter(例:$σ$, $λ$, $\sigma_f^2$, $l$)は、複数の環境における実証的妥当性を用いて調整される。

実験結果

リサーチクエスチョン

  • RQ1事後サンプリングは、強化学習における軌道レベルの好みのフィードバックを扱うように拡張可能か?
  • RQ2疎で相対的な好みを、各状態行動報酬にマッピングする責任割り当てをどのように形式化できるか?
  • RQ3ベイジアン設定下での好みベースの強化学習アルゴリズムに対して、どのような理論的保証を確立できるか?
  • RQ4提案手法は、責任割り当てモデルやハイパーパrameterの変化に対してどれほど頑健か?
  • RQ5既存の好みベースの強化学習ベースラインと比較して、競争力のある性能を達成できるか?

主な発見

  • DPSは、ベイジアン線形回帰による責任割り当てモデルを用いて、漸近的にベイジアンノーレグレット収束を達成し、好みベースの強化学習における最初のレグレット保証を達成した。
  • ランダムMDP、マウンテンカー、RiverSwim環境における実験的評価では、DPSが累積報酬の観点で、既存のベースラインと同等またはそれを上回る性能を示した。
  • すべてのテスト環境において、ハイパーパrameterの選択に対して頑健であり、30~100回の実行で安定した性能を示した。
  • ロジスティックノイズを含むさまざまなユーザーのノイズモデルに対しても性能が維持され、ノイズの多い好みのフィードバックに対して耐性があることを示した。
  • 責任割り当てモデルの選択(例:GP、ベイジアンロジスティック回帰)が最終的な性能にほとんど影響を与えないことから、汎用性が示された。
  • 理論的分析は、事後サンプリングのレグレットに関する情報理論的バウンディングに依拠しており、好みのフィードバック設定に拡張された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。