[論文レビュー] Deep Bayesian Reward Learning from Preferences
本稿では、優先順位ラベルと後続特徴を用いて、MDPを解く必要なく報酬関数の事後分布からの有効なサンプリングを可能にする、深層ベイジアン逆強化学習手法であるBayesian Reward Extrapolation (B-REX) を提案する。B-REX は、高次元の視覚的制御タスクにスケーリング可能であり、模倣方策の高信頼性な性能評価を可能にし、最先端の点推定手法と同等の性能を示すとともに、最悪ケースリスク解析により報酬ハッキングを検出する。
Bayesian inverse reinforcement learning (IRL) methods are ideal for safe imitation learning, as they allow a learning agent to reason about reward uncertainty and the safety of a learned policy. However, Bayesian IRL is computationally intractable for high-dimensional problems because each sample from the posterior requires solving an entire Markov Decision Process (MDP). While there exist non-Bayesian deep IRL methods, these methods typically infer point estimates of reward functions, precluding rigorous safety and uncertainty analysis. We propose Bayesian Reward Extrapolation (B-REX), a highly efficient, preference-based Bayesian reward learning algorithm that scales to high-dimensional, visual control tasks. Our approach uses successor feature representations and preferences over demonstrations to efficiently generate samples from the posterior distribution over the demonstrator's reward function without requiring an MDP solver. Using samples from the posterior, we demonstrate how to calculate high-confidence bounds on policy performance in the imitation learning setting, in which the ground-truth reward function is unknown. We evaluate our proposed approach on the task of learning to play Atari games via imitation learning from pixel inputs, with no access to the game score. We demonstrate that B-REX learns imitation policies that are competitive with a state-of-the-art deep imitation learning method that only learns a point estimate of the reward function. Furthermore, we demonstrate that samples from the posterior generated via B-REX can be used to compute high-confidence performance bounds for a variety of evaluation policies. We show that high-confidence performance bounds are useful for accurately ranking different evaluation policies when the reward function is unknown. We also demonstrate that high-confidence performance bounds may be useful for detecting reward hacking.
研究の動機と目的
- 報酬の不確実性を考慮することで、高次元の視覚的制御タスクにおける安全で頑健な模倣学習を実現すること。
- 従来のベイジアン IRL が内側のループで繰り返し MDP を解く必要があるという計算上の非効率性を克服すること。
- 生のピクセル入力を用いた複雑なタスクにスケーリング可能な、深層ベイジアン IRL 手法の開発。
- 真の報酬が不明な状況でも、高信頼性のオフポリシー評価を可能にすること。
- 事後分布からのサンプルを用いて確率的最悪ケース性能バウンドを計算することで、模倣学習における報酬ハッキングを検出すること。
提案手法
- B-REX は、模倣のデモ間におけるペアワイズ優先順位ラベルを用いて、報酬関数を予測するニューラルネットワークを学習し、MDP を解く必要を回避する。
- 後続特徴表現を用いて、将来の状態訪問確率をモデル化することで、効率的な価値関数一般化を実現する。
- ペアワイズ優先順位ランキングに基づく尤度関数を用いた変分推論フレームワークにより、報酬関数の事後分布からのサンプリングを実施する。
- 事後サンプルを用いて、ポリシー収益の 5%分位数(0.05-VaR)といった高信頼性の性能バウンドを計算する。
- コンsumer レベルのラップトップでも、数分間で数万件の事後サンプルを生成可能であり、スケーラブルな不確実性定量化を実現する。
- 関数近似に深層ニューラルネットワークを活用し、Atari ゲームの生の視覚的観測からエンドツーエンドで学習する。
実験結果
リサーチクエスチョン
- RQ1高次元の視覚的制御タスクに対して、ベイジアン逆強化学習を計算的に実行可能にできるか?
- RQ2ベイジアン IRL において、完全な MDP の解法を代替する、デモに対する優先順位ベースの監視が可能か?
- RQ3深層ベイジアン IRL の事後サンプルが、真の報酬が不明な状況でも高信頼性のオフポリシー評価を可能にするか?
- RQ4事後分布から導出された最悪ケース性能バウンドは、模倣学習における報酬ハッキングを検出できるか?
- RQ5B-REX は、報酬関数の点推定を用いる最先端の深層模倣学習手法と比較して、どの程度の性能を示すか?
主な発見
- B-REX は、コンsumer レベルのラップトップでも数分間で数万件の事後報酬サンプルを生成可能であり、高次元設定におけるスケーラブルなベイジアン推論を実現する。
- B-REX を用いて学習された模倣方策は、報酬関数の点推定のみを用いる最先端の深層模倣学習手法と同等の性能を示す。
- B-REX の事後分布から算出された 0.05-VaR(5%分位数)性能バウンドは、方策の順序付けを正確に反映しており、報酬のスパarsity を利用する「No-Op」方策(Breakout でボールを発射しない方策)のような高リスク行動を特定する。
- 部分的に訓練された方策の真の報酬と、事後分布の平均報酬および 0.05-VaR の間には高い相関が観察され、バウンドの信頼性が裏付けられた。
- 「No-Op」方策は、事後分布における期待報酬は高いが、0.05-VaR は非常に低く(-134.9)あり、高いリスクと報酬ハッキングの可能性を示している。
- 事後分布を用いることで、目的とは相関しないが意図に似せた特徴に過剰適合する方策を検出可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。