Skip to main content
QUICK REVIEW

[論文レビュー] On the Feasibility of Learning, Rather than Assuming, Human Biases for Reward Inference

Rohin Shah, Noah Gundotra|arXiv (Cornell University)|Jun 23, 2019
Decision-Making and Behavioral Economics参考文献 27被引用数 14
ひとこと要約

本稿では、合理的性や短視眼的行動といった特定のバイアスを仮定せずに、微分可能プランナを用いて示範データから人間の計画バイアスを直接学習することを検討している。プランナの学習によりバイアス適合性が向上するが、近似された微分可能プランニングに起因する性能損失がこれを上回るため、データ駆動型バイアス学習を現実可能にするには、より優れた微分可能プランニング手法の開発が求められる。

ABSTRACT

Our goal is for agents to optimize the right reward function, despite how difficult it is for us to specify what that is. Inverse Reinforcement Learning (IRL) enables us to infer reward functions from demonstrations, but it usually assumes that the expert is noisily optimal. Real people, on the other hand, often have systematic biases: risk-aversion, myopia, etc. One option is to try to characterize these biases and account for them explicitly during learning. But in the era of deep learning, a natural suggestion researchers make is to avoid mathematical models of human behavior that are fraught with specific assumptions, and instead use a purely data-driven approach. We decided to put this to the test -- rather than relying on assumptions about which specific bias the demonstrator has when planning, we instead learn the demonstrator's planning algorithm that they use to generate demonstrations, as a differentiable planner. Our exploration yielded mixed findings: on the one hand, learning the planner can lead to better reward inference than relying on the wrong assumption; on the other hand, this benefit is dwarfed by the loss we incur by going from an exact to a differentiable planner. This suggest that at least for the foreseeable future, agents need a middle ground between the flexibility of data-driven methods and the useful bias of known human biases. Code is available at https://tinyurl.com/learningbiases.

研究の動機と目的

  • 逆強化学習において固定されたバイアスを仮定するのではなく、データから人間の計画バイアスを学習することが可能かどうかを検証すること。
  • 人間の示範者が体系的なバイアス(短視眼的行動や計画的誤謬)を示す場合の報酬推定の課題に対処すること。
  • 示範者のプランナをデータ駆動で学習するアプローチが、特定の合理性モデルを仮定する従来のIRL手法を上回るかを評価すること。
  • エンドツーエンドでの人間バイアス学習を現実可能にするために必要な構造的仮定とアルゴリズム的改善を同定すること。

提案手法

  • 示範データから計画プロセスの生成法を学習する微分可能プランナを提案し、計画プロセス全体にわたるバックプロパゲーションを可能にする。
  • 値反復法を微分可能にするために、最大値(max)の代わりにlogsumexpを用いるソフト値反復を採用し、勾配ベースの最適化によるプランナおよび報酬関数の最適化を可能にする。
  • 報酬関数とプランナをバックプロパゲーションにより同時に学習し、最適性への正則化を施して学習の安定化を図る。
  • 真の報酬が既知である教師あり設定で評価し、プランナ部の学習に集中できる環境を整える。
  • 正確な合理的計画(例:値反復)と固定バイアス仮定(例:ノイズあり合理的性)を用いたベースラインと性能を比較する。
  • 共同学習、最適方策からの初期化、座標降下法と共同最適化の影響を評価するアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1微分可能プランナは、特定のバイアスモデルを仮定せずに、示範データから人間のバイアスを学習できるか?
  • RQ2学習済みプランナを用いた報酬推定の性能は、正確で非微分可能なプランナ(例:正確な値反復)と比べてどの程度か?
  • RQ3最適行動を模倣する初期化が、後続の報酬推定性能に与える影響は何か?
  • RQ4報酬とプランナを共同で最適化することは、座標降下法を用いた最適化を上回るか?
  • RQ5成功したバイアス学習のためには、示範者が概ね合理的であるという仮定がどれほど重要か?

主な発見

  • 正確で微分可能な示範者モデル(ソフト値反復)を用いることで、最大報酬の98.1%に達し、計画が正確な場合の性能上限を示した。
  • 提案された微分可能プランナ(アルゴリズム1)は最大報酬の86.9%に達し、計画の近似に起因する顕著な性能低下を示した。
  • アルゴリズム2は、最適行動を模倣する初期化を採用し、最大報酬の86.2%に達した。これにより、初期化が性能に大きく寄与することが確認された。
  • 報酬とプランナの共同学習は座標降下法を上回り、エンドツーエンド最適化が交互更新よりも効果的であることを示した。
  • バイアスの学習による利点は、微分可能計画に起因する近似誤差に打ち勝てず、現在のディープラーニングアーキテクチャではこのアプローチがまだ適切でないことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。