Skip to main content
QUICK REVIEW

[論文レビュー] Identifiability in inverse reinforcement learning

Haoyang Cao, Samuel N. Cohen|arXiv (Cornell University)|Jun 7, 2021
Reinforcement Learning in Robotics参考文献 23被引用数 5
ひとこと要約

この論文は、エントロピー正則化のもとで、最適方策が2つの異なる割引率または十分に異なる環境で観測される場合、真の報酬関数が定数のずれを除いて一意に回復可能であることを示すことにより、逆強化学習(IRL)における同定不能性の問題を解決する。主な洞察は、価値関数と方策が一貫する報酬の空間をパラメータ化できることであり、複数の行動観測が利用可能な場合に再構築が可能になる。

ABSTRACT

Inverse reinforcement learning attempts to reconstruct the reward function in a Markov decision problem, using observations of agent actions. As already observed in Russell [1998] the problem is ill-posed, and the reward function is not identifiable, even under the presence of perfect information about optimal behavior. We provide a resolution to this non-identifiability for problems with entropy regularization. For a given environment, we fully characterize the reward functions leading to a given policy and demonstrate that, given demonstrations of actions for the same reward under two distinct discount factors, or under sufficiently different environments, the unobserved reward can be recovered up to a constant. We also give general necessary and sufficient conditions for reconstruction of time-homogeneous rewards on finite horizons, and for action-independent rewards, generalizing recent results of Kim et al. [2021] and Fu et al. [2018].

研究の動機と目的

  • 逆強化学習における根本的な同定不能性問題に対処すること。この問題では、複数の報酬関数が同じ最適方策を生成する可能性がある。
  • エントロピー正則化されたマークフ・決定過程(MDP)において、与えられた最適方策と整合する報酬関数の全空間を特定すること。
  • 異なる環境や割引率で観測された行動データから、真の報酬が定数のずれを除いて一意に回復可能となる条件を確立すること。
  • キムら(2021年)およびフウら(2018年)の先行研究を一般化し、時不変かつ行動に依存しない報酬の結果を拡張すること。
  • 報酬の曖昧性を形式的に特徴づけることにより、即時の報酬と将来の報酬の影響を分離すること。

提案手法

  • 著者らは、逆学習問題の安定化と同定性の向上を図るため、エントロピー正則化されたマークフ・決定過程(MDP)を用いる。
  • 与えられた最適方策をもたらすすべての報酬関数のパラメータ化を導出し、この空間が制御問題の価値関数によって完全に決定されることを示す。
  • エントロピー正則化された設定におけるベルマン方程式を通じて、最適方策、価値関数、報酬の関係を活用する。
  • 2つの異なる割引率(例:γ₁ = 0.95 と γ₂ = 0.25)で観測された最適方策を用いることで、真の報酬関数が定数のずれを除いて一意に再構築可能である。
  • 複数の環境や割引率で方策予測誤差を同時に最小化する損失関数を用い、最適化に基づく報酬回復を可能にする。
  • 数値実験ではAdam最適化を用い、報酬と価値関数推定のℓ₂誤差を用いて回復精度を評価する。

実験結果

リサーチクエスチョン

  • RQ1逆強化学習において、問題が本質的に不適切に定義されていても、観測された最適方策から真の報酬関数を一意に同定できるか?
  • RQ2エントロピー正則化は、マークフ・決定過程における報酬の同定性にどのように影響するか?
  • RQ3複数の最適方策が異なる割引率で観測された場合、報酬が定数のずれを除いて回復可能となる条件は何か?
  • RQ4有限時限のMDPにおいて、時不変かつ行動に依存しない報酬を同定するための一般的な必要十分条件は何か?
  • RQ5価値関数が、方策が与えられたもとで報酬関数を再構築するのに十分統計量として機能する程度はどの程度か?

主な発見

  • 単一の割引率のもとで最適方策の知識が完全に得られたとしても、報酬関数は同定不能であるが、一貫する報酬の集合は価値関数によって完全にパラメータ化可能である。
  • 2つの異なる割引率(例:γ₁ = 0.95 と γ₂ = 0.25)で最適方策が観測された場合、真の報酬関数が定数のずれを除いて一意に回復可能である。
  • 数値実験では、2つの方策を用いた場合、訓練損失がほぼゼロに減少し、報酬回復のℓ₂誤差は単一の方策を用いた場合と比べて1桁小さい。
  • 学習された報酬行列は真の報酬と非常に近く、図6に示すように、大きさのオーダーで10⁻¹の差異を示す。
  • 複数の方策が用いられた場合、価値関数推定の誤差も顕著に低減され、γ₁およびγ₂においてℓ₂誤差が10⁻³のオーダーにまで低下する(図7参照)。
  • 本手法は、両方の割引率で真の最適方策に近い方策を効果的に再構築できており、差異が10⁻³のオーダーであるため、報酬回復の正確性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。