Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Hierarchy-Aware Inverse Reinforcement Learning

Chris Cundy, Daniel Filan|arXiv (Cornell University)|Jul 13, 2018
Reinforcement Learning in Robotics参考文献 13被引用数 3
ひとこと要約

本稿では、階層的計画(エージェントが原始的行動の代わりに再利用可能なオプションを使用する)を考慮することで、行動から人間の好みを推論する、ベイジアン逆強化学習(BIHRL)を提案する。BIHRLは、おもちゃのタクシー環境およびWikispeediaゲームの両方で、標準的なベイジアン逆強化学習(BIRL)を上回り、ゴール予測精度が66%(BIRLは62%)にまで向上した。これは、事前に階層的構造が弱くしか分かっていない状況でも成立する。

ABSTRACT

We introduce a new generative model for human planning under the Bayesian Inverse Reinforcement Learning (BIRL) framework which takes into account the fact that humans often plan using hierarchical strategies. We describe the Bayesian Inverse Hierarchical RL (BIHRL) algorithm for inferring the values of hierarchical planners, and use an illustrative toy model to show that BIHRL retains accuracy where standard BIRL fails. Furthermore, BIHRL is able to accurately predict the goals of `Wikispeedia' game players, with inclusion of hierarchical structure in the model resulting in a large boost in accuracy. We show that BIHRL is able to significantly outperform BIRL even when we only have a weak prior on the hierarchical structure of the plans available to the agent, and discuss the significant challenges that remain for scaling up this framework to more realistic settings.

研究の動機と目的

  • 標準的な逆強化学習(IRL)が人間の非合理的行動や階層的意思決定をモデル化できないという限界に対処すること。
  • 原始的行動の代わりに再利用可能な行動シーケンス(オプション)を用いる階層的計画として人間の意思決定をモデル化するベイジアンフレームワークの開発。
  • 人間が部分目標に基づく階層的戦略を用いる状況における好みの推論精度の向上。
  • 真の階層的構造が事前に不明または弱くしか指定されていない場合のモデルの頑健性の評価。
  • 実世界の人間の軌道データ(例:Wikispeediaゲーム)を用いたスケーラビリティと有効性の実証。

提案手法

  • 人間の行動が、各オプション(高レベルの行動)に割り当てられた方策、開始集合、終了関数を備えたもとで、ボルツマン合理的選択としてモデル化される生成モデルを提案。
  • Ramachandran & Amir (2007) が提唱した Policy-Walk アルゴリズムを拡張し、階層的MDPフレームワーク内で報酬とオプションのベイズ推論を実行。
  • 構造的環境における人間のスキルを妥当とみなせる、最大3つの決定的オプションの集合に対する事前分布を用いる。
  • 潜在的なオプション集合の周辺化を実行し、報酬関数の事後分布を推論するために、マルコフ連鎖モンテカルロ(MCMC)サンプリングを採用。
  • モデルを、おもちゃのタクシー環境およびWikispeediaウェブナビゲーションゲームに適用し、標準的なBIRLと性能を比較。
  • Q値が行動を生成するために使用された同一の確率的方策に基づいて計算される、自己一貫性のあるボルツマン方策を組み込む。

実験結果

リサーチクエスチョン

  • RQ1階層的計画を考慮するベイジアン逆強化学習モデルは、好みの推論において標準的なBIRLを上回ることができるか?
  • RQ2階層的オプションの導入が、実世界のナビゲーションタスクにおける人間のゴール予測精度にどのように影響するか?
  • RQ3真のオプション構造が事前に不明な状況でも、BIHRLは正しい好みをどれだけ正確に推論できるか?
  • RQ4オプションに弱い事前分布しか与えられていない場合でも、BIHRLはBIRLに比べて性能優位性を維持できるか?
  • RQ5複雑な人間行動を示す大規模で現実的な環境にこのフレームワークを拡張する際の計算的・スケーラビリティ上の課題は何か?

主な発見

  • おもちゃのタクシー環境では、BIHRLが真の報酬に0.55の確率質量を割り当てたのに対し、標準的なBIRLは0.03未満にとどまり、事後信頼度で20倍の向上を示した。
  • Wikispeediaデータセットでは、BIHRLがゴール予測精度をBIRLのベースライン62%から66%まで向上させ、手動で設計された特徴量がなくても顕著な性能向上を達成した。
  • 真のオプション集合が事前に分かっていない状況でも、妥当なオプションに対する弱い事前分布に依存するだけで、正しい報酬関数を高い事後確率で推論できた。
  • BIHRLの性能向上は、さまざまな合理性パラメータ(β)の水準において一貫しており、人間の非最適性の度合いが異なる状況でも有効であることが示された。
  • すべての可能なオプション集合に対する完全な周辺化は計算的に不可能であるが、MCMCに基づく推論手順は、小規模な環境において実行可能であることが示された。
  • 結果から、階層的構造は正確な好みの推論において重要な要素であることが示唆され、エージェントがオプションを非最適に使用する場合、標準的なIRLは失敗することが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。