[論文レビュー] Impossibility of deducing preferences and rationality from human policy.
この論文は、人間の合理性に関する規範的仮定がなければ、理想のデータが得られても、行動からの人間の報酬関数の同定は不可能であることを証明している。標準的な逆強化学習(IRL)が、追加の規範的制約がなければ不成立であることを示す、自由定理(Free Theorem)を確立している。
Inverse reinforcement learning (IRL) attempts to infer human rewards or preferences from observed behavior. However, human planning systematically deviates from rationality. Though there has been some IRL work which assumes humans are noisily rational, there has been little analysis of the general problem of inferring the reward of a human of unknown rationality. The observed behavior can, in principle, be decomposed into two composed into two components: a reward function and a planning algorithm that maps reward function to policy. Both of these variables have to be inferred from behaviour. This paper presents a Free theorem in this area, showing that, without making `normative' assumptions beyond the data, nothing about the human reward function can be deduced from human behaviour. Unlike most No Free Lunch theorems, this cannot be alleviated by regularising with simplicity assumptions. The simplest hypotheses are generally degenerate. The paper will then sketch how one might begin to use normative assumptions to get around the problem, without which solving the general IRL problem is impossible. The reward function-planning algorithm formalism can also be used to encode what it means for an agent to manipulate or override human preferences.
研究の動機と目的
- 逆強化学習における観察された行動から人間の好みを推論する理論的限界を調査すること。
- 人間の計画が合理性から逸脱する場合に、標準的なIRLアプローチがなぜ失敗するかを特定すること。
- 行動を報酬関数と計画アルゴリズムに分解することを、好みの推論の核心的課題として形式化すること。
- 観察された行動を超えて規範的仮定がなければ、人間の報酬に関するいかなる推論も不可能であることを示すこと。
- 実際の状況で、この理論的不可能性を乗り越えるために規範的仮定がどのように機能するかを検討すること。
提案手法
- 行動を報酬関数と計画アルゴリズムの合成として形式化し、両者とも方策に写像する。
- 最小限の仮定の下で、行動から報酬関数に関する情報が一切得られないことを証明する自由定理を導入する。
- 単純性仮定が正則化に果たす役割を分析し、退化した仮説による不確実性が単純性正則化では解消されないことを示す。
- 報酬-計画形式を用いて、エージェントによる好みの操作や上書きをモデル化する。
- データや単純性による正則化だけでは問題が解けず、推論を進めるには規範的制約が必要であることを示す。
実験結果
リサーチクエスチョン
- RQ1人間の報酬関数は、追加の仮定なしに観察された行動から一意に同定可能か?
- RQ2人間の計画が非合理的である場合に、逆強化学習の根本的な理論的限界は何か?
- RQ3単純性仮定による正則化は、報酬と計画の成分間の曖昧さをどの程度解消できるか?
- RQ4この理論的不可能性に対処するために、どのように規範的仮定を意味的に導入できるか?
- RQ5報酬-計画形式は、エージェントによる好みの操作をどのような方法でモデル化できるか?
主な発見
- 人間の報酬関数は、合理性に関する規範的仮定なしには、行動から理論的に同定できない。
- 自由定理により、複数の報酬関数と計画アルゴリズムの組み合わせが同一の行動を生じさせることができることを示し、推論が決定不能であることを確立している。
- 単純性に基づく正則化は、単純な仮説が通常退化しており識別不能であるため、問題を解消できない。
- 報酬-計画形式は、エージェントが人間の好みを上書きまたは歪める場合のモデル化フレームワークを提供する。
- 規範的仮定がなければ、一般逆強化学習問題の解決は根本的になされない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。