Skip to main content
QUICK REVIEW

[論文レビュー] Understanding Learned Reward Functions

Eric J. Michaud, Adam Gleave|arXiv (Cornell University)|Dec 10, 2020
Explainable Artificial Intelligence (XAI)参考文献 27被引用数 4
ひとこと要約

この論文は強化学習における学習済み報酬関数の監査に、サリエンシー・マップと対向的分析を用いることを提案しており、報酬関数がしばしばコアな好みではなく、環境依存の誤った特徴に依存していることを明らかにしている。報酬出力に大きな変化があっても、その報酬関数に基づいて訓練された方策は依然として良好な性能を示すため、現在の解釈可能性手法は方策の頑健性を予測できず、関係のない変化を強調する可能性がある。

ABSTRACT

In many real-world tasks, it is not possible to procedurally specify an RL agent's reward function. In such cases, a reward function must instead be learned from interacting with and observing humans. However, current techniques for reward learning may fail to produce reward functions which accurately reflect user preferences. Absent significant advances in reward learning, it is thus important to be able to audit learned reward functions to verify whether they truly capture user preferences. In this paper, we investigate techniques for interpreting learned reward functions. In particular, we apply saliency methods to identify failure modes and predict the robustness of reward functions. We find that learned reward functions often implement surprising algorithms that rely on contingent aspects of the environment. We also discover that existing interpretability techniques often attend to irrelevant changes in reward output, suggesting that reward interpretability may need significantly different methods from policy interpretability.

研究の動機と目的

  • 手動による指定が不可能な現実世界の強化学習タスクにおいて、学習済み報酬関数が本当に人間の好みを反映しているかどうかを検証する課題に対処すること。
  • サリエンシー・マップのような解釈可能性技術が、誤った相関関係への依存といった報酬関数の障害モードを検出できるかどうかを調査すること。
  • 現在の解釈可能性手法が、学習済み報酬関数に基づいて訓練された方策の頑健性を予測できるかどうかを評価すること。
  • 報酬関数の文脈において、方策の解釈可能性とは根本的に異なる、現在の解釈可能性ツールの限界を特定すること。
  • とくに、単調変換に対して不変であるという点を含め、報酬関数の数学的構造に特化した新しい解釈可能性手法の導入を提唱すること。

提案手法

  • 学習済み報酬関数の出力に最も影響を与える入力特徴を特定するために、サリエンシー手法を適用すること。
  • 特定の環境的特徴を削除または変更するような対向的入力(例:ブレーキインジケータの状態)を用いて、報酬関数出力の変化をテストすること。
  • 解釈可能性の忠実度を評価するために、サリエンシー・マップと対向的変化を、真値報酬関数と比較すること。
  • TwoGoals や Seaquest といった環境を用いて、報酬出力の変化と方策性能の変化の相関関係を評価すること。
  • 変更された報酬関数に基づいて訓練された方策の頑健性を評価し、サリエンシー手法が方策の移行性を予測できるかどうかを検証すること。
  • EPIC をベンチマークとして用い、学習済み報酬関数と真値を比較するが、真値が存在しない場合の限界を認識していること。

実験結果

リサーチクエスチョン

  • RQ1学習済み報酬関数は、コアな人間の好みではなく、環境に依存する誤った特徴や一時的な特徴に依存しているのか?
  • RQ2サリエンシーに基づく解釈可能性手法は、報酬関数が依存する特徴を信頼性高く特定できるのか?
  • RQ3報酬関数出力の変化が、それらに基づいて訓練された方策の行動変化をどの程度まで予測できるのか?
  • RQ4なぜ報酬出力に大きな変化があっても方策性能に影響がない場合があるのか、そしてこれは解釈可能性にどのような意味を持つのか?
  • RQ5学習済み報酬関数が真の人の好みを反映しているかどうかを検証するには、どのような種類の解釈可能性手法が必要なのか?

主な発見

  • 学習済み報酬関数はしばしば、ドライブタスクにおけるブレーキインジケータの状態といった、環境に依存する特徴に依存する直感に反するアルゴリズムを実装している。
  • サリエンシー手法は、方策行動に影響しない乗法的スケーリングのような、関係のない報酬出力の変化に頻繁に注目する。
  • 特定の特徴を削除したことで報酬関数出力が大きく変化しても、方策は依然として高い報酬を達成できるため、現在の解釈可能性ツールの予測能力が低いことが示唆される。
  • ノイズや損傷のある特徴(例:Seaquest でのスコアの削除)に基づいて訓練された報酬関数ですら、ランダムより優れた方策を学習できるため、出力の摂動に対して頑健であることが示唆される。
  • 解釈可能性手法に単調変換に対して不変でないという欠陥があるため、誤解を招く差異を強調する可能性があり、報酬関数の監査における有用性が低下する。
  • 報酬関数の独自の数学的構造(特に正のアフィン変換に対して不変であること)を考慮した、新しい解釈可能性技術の開発が急務である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。