Skip to main content
QUICK REVIEW

[論文レビュー] Preferences Implicit in the State of the World

Rohin Shah, Dmitrii Krasheninnikov|arXiv (Cornell University)|Feb 12, 2019
Bayesian Modeling and Causal Inference被引用数 15
ひとこと要約

本稿では、報酬学習による過去の模倣(RLSP)を提案する。このアルゴリズムは、最大因果エントロピー逆強化学習(MCE-IRL)を用い、人間が最適化した状態を反映していると仮定した環境の初期状態から、人間の好みを推定する。明示的な報酬設計なしに、破壊されるのを避ける(例:花瓶を壊すこと)や、リンゴを収穫するなどのアクティブなタスクを推定する能力を示し、世界状態に内蔵された暗黙の好みが、安全かつ目的指向的な行動を導く可能性を示している。

ABSTRACT

Reinforcement learning (RL) agents optimize only the features specified in a reward function and are indifferent to anything left out inadvertently. This means that we must not only specify what to do, but also the much larger space of what not to do. It is easy to forget these preferences, since these preferences are already satisfied in our environment. This motivates our key insight: when a robot is deployed in an environment that humans act in, the state of the environment is already optimized for what humans want. We can therefore use this implicit preference information from the state to fill in the blanks. We develop an algorithm based on Maximum Causal Entropy IRL and use it to evaluate the idea in a suite of proof-of-concept environments designed to show its properties. We find that information from the initial state can be used to infer both side effects that should be avoided as well as preferences for how the environment should be organized. Our code can be found at https://github.com/HumanCompatibleAI/rlsp.

研究の動機と目的

  • 強化学習における完全な報酬関数の指定の課題、特に予期しない副作用の回避に特化して解決すること。
  • 環境の初期状態が人間の最適化を反映しているという事実を、人間の好みに関する情報の源として活用すること。
  • 説明データや人間のフィードバックを必要とせず、状態そのものから好みを推定する手法を開発すること。
  • 初期状態が、回避すべき副作用と実行すべきタスクに関する情報を保持しているかどうかを評価すること。
  • RLSPが暗黙の人間の好みを組み込むことで、強化学習におけるサンプル効率と安全性が向上することを実証すること。

提案手法

  • 本手法は、初期状態 $ s_0 $ が人間が最適化した状態を反映していると仮定しており、これにより過去の人間行動が否定的結果を避けていたと示唆する。
  • 最大因果エントロピー逆強化学習(MCE-IRL)を用い、$ s_0 $ が人間行動のもとで生じやすい理由を説明する報酬関数 $ \theta_{\text{Alice}} $ を推定する。
  • 既知のダイナミクスと手動で定義された特徴量を仮定し、$ s_0 $ に至る可能性のある過去の軌道をシミュレートすることで、人間報酬 $ \theta_{\text{Alice}} $ のMAP推定値を計算する。
  • 推定された人間報酬 $ \theta_{\text{Alice}} $ を、指定された報酬 $ \theta_{\text{spec}} $ と重み付き和で結合し、最終的な報酬 $ \theta_{\text{final}} $ を形成する。
  • ロボットは、$ \theta_{\text{final}} $ を最適化する行動をとることで、タスク遂行と副作用回避のバランスを取る。
  • 本手法は、副作用回避とアクティブタスク遂行の推論をテストするためのグリッドワールド環境で評価されている。

実験結果

リサーチクエスチョン

  • RQ1環境の初期状態は、花瓶を壊すのを避けるなど、副作用に関する人間の好みを暗黙的に含んでいるだろうか?
  • RQ2初期状態は、リンゴを収穫する、バッテリーを充電するといったアクティブなタスクに関する好みも含んでいるだろうか?
  • RQ3説明データがなく、人間のフィードバックもなしに、状態と既知のダイナミクスのみを用いて、RLSPがこれらの好みをどれほど正確に推定できるか?
  • RQ4ダイナミクスが不明または特徴量が曖昧な場合、単一の状態から好みを推定する際の限界は何か?
  • RQ5推定された好みと指定された報酬を組み合わせた場合、全体のタスク遂行性能と安全性にどのような影響があるか?

主な発見

  • 人間の行動によって最適化された環境の初期状態には、回避すべき副作用や遂行すべきタスクに関する人間の好みの暗黙の情報が含まれている。
  • 報酬関数にそのようなペナルティが明示的に設定されていなくても、RLSPは花瓶を壊すことを避けるべきであると正しく推定した。
  • 木の近くに置かれたバスケットにリンゴが入っている状態から、収穫を希望するという好みを正しく推定し、ロボットがその暗黙のタスクに応じた行動を取ることができた。
  • グリッドワールド環境において、計画の予測期間 $ T $ や初期状態の事前分布 $ s_{-T} $ の変化に対しても、本手法は頑健であることが示された。
  • しかし、初期状態が人間の最適化の結果でない場合(例:大気中の酸素)、RLSPは関連する好みを正しく推定できなかった。
  • 推定された人間の好み(現状維持志向)と指定された報酬との間に矛盾が生じたことが明らかになった。これにより、報酬の組み合わせ方法の改善や、人間への照会メカニズムの導入が求められることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。