Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Bayesian Inverse Reinforcement Learning

Alex Chan, Mihaela van der Schaar|arXiv (Cornell University)|Feb 12, 2021
Reinforcement Learning in Robotics参考文献 39被引用数 11
ひとこと要約

本論文は、ニューラルネットワークを用いてオフラインでエンドツーエンドに、報酬の変分後確率分布と模倣ポリシーを同時に学習するスケーラブルなベイジアン逆強化学習手法AVRILを提案する。臨床意思決定や制御タスクなど複雑な環境でもベイジアン報酬推論を可能にし、最先端のオフライン模倣学習と同等の性能を達成するとともに、解釈可能な報酬の洞察と不確実性推定を提供する。

ABSTRACT

Bayesian inference over the reward presents an ideal solution to the ill-posed nature of the inverse reinforcement learning problem. Unfortunately current methods generally do not scale well beyond the small tabular setting due to the need for an inner-loop MDP solver, and even non-Bayesian methods that do themselves scale often require extensive interaction with the environment to perform well, being inappropriate for high stakes or costly applications such as healthcare. In this paper we introduce our method, Approximate Variational Reward Imitation Learning (AVRIL), that addresses both of these issues by jointly learning an approximate posterior distribution over the reward that scales to arbitrarily complicated state spaces alongside an appropriate policy in a completely offline manner through a variational approach to said latent reward. Applying our method to real medical data alongside classic control simulations, we demonstrate Bayesian reward inference in environments beyond the scope of current methods, as well as task performance competitive with focused offline imitation learning algorithms.

研究の動機と目的

  • 複雑で高次元な環境におけるベイジアン逆強化学習(BIRL)のスケーラビリティの制限を解消すること。
  • 環境との相互作用なしに安全にオフラインで模倣学習を実現すること。これは医療分野のような高リスク応用にとって不可欠である。
  • 報酬の後確率分布を提供し、不確実性を捉え、模倣者の好みを明らかにすること。
  • 変分後確率分布とポリシーネットワークを、自己符号化器に類似したフレームワークで同時に最適化すること。
  • 血圧や酸素濃度といった現実世界の臨床的優先事項を反映する解釈可能な報酬表現を提供すること。

提案手法

  • AVRILは、報酬を行動の潜在的表現とみなして、報酬の後確率を近似するための変分ベイジアンフレームワークを用いる。
  • 模倣データ軌道を報酬分布にマップするエンコーダーネットワークと、報酬に条件付けられた行動を生成するデコーダー(ポリシーネットワーク)を採用する。
  • 内側のMDPソルバーを回避するため、模倣データにわたる推論をアモアタイズド推論で行い、エンドツーエンドでオフラインに学習する。
  • 報酬の後確率はアモアタイズド推論により近似され、大規模な状態空間や深層ニューラルネットワークのような複雑な関数クラスへのスケーラビリティを実現する。
  • 再構成誤差とKLダイバージェンスの項を最小化する共同最適化目的関数により、柔軟な報酬モデリングとポリシー学習を可能にする。
  • 状態特徴量上の線形モデルを通じて解釈可能な報酬表現をサポートし、報酬を高める環境要因を特定できる。

実験結果

リサーチクエスチョン

  • RQ1内側のMDPソルバーを必要とせずに、複雑で高次元な環境にベイジアン逆強化学習をスケーラブルに適用できるか?
  • RQ2オフライン模倣学習は、医療分野のような実世界の応用において、高いポリシー性能と意味のある報酬推論を両立できるか?
  • RQ3報酬後確率の不確実性を活用することで、高リスク意思決定における安全性と解釈性を向上させられるか?
  • RQ4共同変分推論フレームワークは、静的模倣データから報酬とポリシーの両方の表現を効果的に学習できるか?
  • RQ5学習された報酬モデルは、血行動態的安定性といった臨床的関連優先事項をどの程度反映できるか?

主な発見

  • AVRILは、制御タスクおよび実際の医療データにおいて、専用のオフライン模倣学習アルゴリズムと同等のポリシー性能を達成しているが、完全にオフラインかつベイジアンであるにもかかわらず、その性能を維持している。
  • 本手法は、従来BIRLでは扱いきれないほど複雑な環境、特にMIMIC-IIIにおける複雑な医療意思決定においても、ベイジアン報酬推論を成功裏に実行した。
  • グリッドワールド環境において、報酬後確率の平均は真の報酬とよく一致しており、未訪問状態では不確実性(標準偏差)が集中しており、エピステミック不確実性を反映している。
  • 線形報酬モデルを用いた場合、AVRILは血圧が状態の質を決定づける最も影響力のある要因であると特定しており、臨床的知識と整合的である。
  • 呼吸支援行動が血酸素濃度が平均未満に下がると強く報酬され、直感的かつ臨床的に妥当な報酬設計を示している。
  • 線形係数解析を通じて解釈性を実現し、モデルが血圧や酸素化状態といった既知の臨床指標を優先して学習していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。