Skip to main content
QUICK REVIEW

[論文レビュー] Inverse Reinforcement Learning with Conditional Choice Probabilities

Mohit Sharma, Kris Kitani|arXiv (Cornell University)|Sep 22, 2017
Innovation Diffusion and Forecasting参考文献 21被引用数 4
ひとこと要約

本稿では、反復的動的計画法の代わりに条件付き選択確率(CCPs)を用いることで計算コストを著しく削減する逆強化学習手法CCP-IRLを提案する。実験的遷移から推定されたCCPsを用いて価値関数をモデル化することで、繰り返しDPの呼び出しを回避し、グリッドワールドおよびオブジェクトワールドのベンチマークでMaxEnt-IRLと同等の報酬回復品質を維持しながら、最大5倍の高速化を達成する。

ABSTRACT

We make an important connection to existing results in econometrics to describe an alternative formulation of inverse reinforcement learning (IRL). In particular, we describe an algorithm using Conditional Choice Probabilities (CCP), which are maximum likelihood estimates of the policy estimated from expert demonstrations, to solve the IRL problem. Using the language of structural econometrics, we re-frame the optimal decision problem and introduce an alternative representation of value functions due to (Hotz and Miller 1993). In addition to presenting the theoretical connections that bridge the IRL literature between Economics and Robotics, the use of CCPs also has the practical benefit of reducing the computational cost of solving the IRL problem. Specifically, under the CCP representation, we show how one can avoid repeated calls to the dynamic programming subroutine typically used in IRL. We show via extensive experimentation on standard IRL benchmarks that CCP-IRL is able to outperform MaxEnt-IRL, with as much as a 5x speedup and without compromising on the quality of the recovered reward function.

研究の動機と目的

  • 報酬最適化中に繰り返し動的計画法の呼び出しを要する最先端のIRLアルゴリズムの高い計算コストを軽減すること。
  • 条件付き選択確率(CCPs)を用いて、構造的エコノメトリクスとロボット工学における逆強化学習を結びつけること。CCPsは価値関数反復の計算的に効率的な代替手段として機能する。
  • 繰り返しMDPの解法を必要とせず、観測された専門家行動とCCPsのみを用いて報酬関数を推定する手法を開発すること。
  • CCPベースのIRLが、特に複雑または大規模なMDPにおいて、訓練時間の著しい短縮を実現しながらも、性能品質を維持または向上させることを示すこと。

提案手法

  • MDPを動的離散選択(DDC)モデルで定式化し、報酬に独立同一分布に従うGumbel分布のノイズを導入することで、専門家行動の確率的性質をモデル化する。
  • 専門家デモから得られる行動確率の最尤推定であるCCPsに基づいて、現在の報酬と将来の価値の差分を用いた、価値関数の新規表現を導入する。
  • 価値関数をCCPsと報酬パラメータの関数として表現することで、最適化ステップごとにベルマン方程式を解く必要がなくなり、直接計算が可能になる。
  • 勾配ベースの最適化を用いて報酬パラメータを更新し、価値関数の推定値はCCPsと報酬関数パラメータのみから得る。
  • 非線形報酬関数の場合は、報酬関数を深層ニューラルネットワークでパラメータ化し、CCP-IRLを拡張してDeepCCP-IRLを構築する。この場合も計算効率を維持する。
  • 反復的価値反復を回避するため、動的計画法サブルーチンをCCPsに基づく閉形式の式に置き換え、全体の計算量を1イテレーションあたり約1回のMDP解法にまで削減する。

実験結果

リサーチクエスチョン

  • RQ1反復的動的計画法を必要とせず、条件付き選択確率(CCPs)を用いて価値関数を表現することは可能か?
  • RQ2反復的価値関数計算をCCPsに基づく推定に置き換えることで、計算コストを著しく削減しつつ報酬回復の正確性を維持できるか?
  • RQ3CCP-IRLは、大規模な状態空間や非線形報酬関数を有する複雑なMDPにおいて、MaxEnt-IRLと比較してどのように性能を発揮するか?
  • RQ4CCP-IRLは、安定したCCP推定に必要な専門家遷移の数はどの程度か?(データ効率)
  • RQ5問題の複雑さに応じて、CCP-IRLの計算的利点はスケーリングするか?特に多くの価値反復ステップを要するMDPにおいて顕著か?

主な発見

  • CCP-IRLは、標準的なIRLベンチマークにおいてMaxEnt-IRLと比較して最大5倍の高速化を達成し、最適化イテレーション数の増加に伴って計算時間の増加はわずかである。
  • グリッドワールドおよびオブジェクトワールド環境において、CCP-IRLとMaxEnt-IRLの報酬分布がほぼ同一であることが示され、高品質な報酬回復が維持されている。
  • 深層ニューラルネットワークを用いた非線形設定では、DeepCCP-IRLは小規模および大規模な状態空間において、DeepMaxEnt-IRLと比較して約5倍速い。
  • 問題の複雑さが増すと、CCP-IRLの計算的利点が拡大する。オブジェクトワールドでは価値反復の収束に時間がかかるが、DeepCCP-IRLは性能劣化が最小限に抑えられる。
  • CCP-IRLは、CCP推定の安定性を確保するため、MaxEnt-IRLよりも多くの専門家遷移(安定した性能のため約40件)を必要とするが、これは信頼性の高い方策推定の必要性に起因する。
  • CCP-IRLとMaxEnt-IRLの両者とも、オブジェクトワールドで非線形報酬構造を的確に捉え、推定された報酬関数と真の報酬関数の間で定性的に一致している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。