Skip to main content
QUICK REVIEW

[論文レビュー] Choice Set Misspecification in Reward Inference

Rachel Freedman, Rohin Shah|arXiv (Cornell University)|Jan 19, 2021
Reinforcement Learning in Robotics参考文献 8被引用数 4
ひとこと要約

本稿は、報酬推論における選択肢集合の誤設定を導入し、ロボットが人間が選べたフィードバックオプションの集合を誤って仮定する状況を扱う。誤設定を5つの明確に区別できるクラスに分類し、一部のタイプは深刻な性能低下(真の報酬とは逆の報酬を推定するなど)を引き起こすが、他のタイプは期待値において証明可能に中立的であることを示す。これにより、より頑健な報酬学習システムの設計が可能になる。

ABSTRACT

Specifying reward functions for robots that operate in environments without a natural reward signal can be challenging, and incorrectly specified rewards can incentivise degenerate or dangerous behavior. A promising alternative to manually specifying reward functions is to enable robots to infer them from human feedback, like demonstrations or corrections. To interpret this feedback, robots treat as approximately optimal a choice the person makes from a choice set, like the set of possible trajectories they could have demonstrated or possible corrections they could have made. In this work, we introduce the idea that the choice set itself might be difficult to specify, and analyze choice set misspecification: what happens as the robot makes incorrect assumptions about the set of choices from which the human selects their feedback. We propose a classification of different kinds of choice set misspecification, and show that these different classes lead to meaningful differences in the inferred reward and resulting performance. While we would normally expect misspecification to hurt, we find that certain kinds of misspecification are neither helpful nor harmful (in expectation). However, in other situations, misspecification can be extremely harmful, leading the robot to believe the opposite of what it should believe. We hope our results will allow for better prediction and response to the effects of misspecification in real-world reward inference.

研究の動機と目的

  • 報酬推論における新たな誤設定要因を特定・形式化すること:人間のフィードバック選択肢集合に関する誤った仮定。
  • 人間とロボットの選択肢集合の関係および最適なフィードバックの位置に基づき、実験的に区別可能な明確なクラスに選択肢集合の誤設定を分類すること。
  • 異なる誤設定クラスが推定報酬およびそれによるエージェントの性能に与える影響を分析すること。これには、後悔(regret)と信念の正確性が含まれる。
  • すべての誤設定が同じほど有害というわけではないことの証明を示すこと。一部のタイプは期待値において証明可能に中立的である。
  • 有害な誤設定を最小限に抑える戦略(例えば、ロボットの選択肢集合を大きくすること)を特定し、より頑健な報酬学習システムの設計に寄与すること。

提案手法

  • 報酬合理的な暗黙的選択(RRiC)フレームワーク内に選択肢集合の誤設定を形式化し、人間のフィードバックが選択集合 C_H から抽出され、ロボットの信念が C_R から抽出されるようにモデル化する。
  • 集合の関係(例:C_H ⊆ C_R、C_R ⊆ C_H)および最適なフィードバック c* の両方の集合における位置に基づき、5つの誤設定クラスを定義する。
  • 人間の選択確率をモデル化するために、合理的なパrameter β を用いたボルツマン合理的性を用いる。
  • ベイズの定理を用いて報酬パrameter θ に関する確率的推論を行う:P(θ|c_H, C_R) ∝ P(c_H|θ, C_R)P(θ),ここで P(c_H|θ, C_R) は RRiC モデルによって計算される。
  • 後悔(regret)を用いて性能を評価する。後悔とは、真の報酬と誤設定下での推定報酬の間の期待報酬の差である。
  • 異なる誤設定クラス下での推定信念とそれによる行動を比較するため、選択肢集合の仮定が異なるグリッドワールド環境で実験的評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1ロボットが人間のフィードバックオプションの選択肢集合を誤って仮定することは、推定報酬およびそれによるエージェント行動にどのように影響するか?
  • RQ2特定の選択肢集合の誤設定クラスは、誤った仮定があるにもかかわらず、期待値において証明可能に中立的であるか?
  • RQ3どのタイプの選択肢集合の誤設定が、真の報酬とは逆の報酬を推定するなど、最も深刻な性能低下を引き起こすか?
  • RQ4ロボットの選択肢集合の構造をどのように設計すれば、有害な誤設定のリスクを体系的に低減できるか?
  • RQ5どのような条件下で選択肢集合の誤設定が期待性能に影響を及ぼさず、これは安全なロボット学習に何を示唆するか?

主な発見

  • 選択肢集合の誤設定は深刻な性能低下を引き起こす可能性があり、特にクラス B3 ではロボットが真の報酬とは逆の報酬を推定し、高い後悔を生じる。
  • 一方、最適なフィードバックが人間とロボットの両方の選択集合に存在し、ロボットの集合がより大きい場合(クラス A2)、誤設定は期待値において証明可能に中立的であり、期待性能に変化がない。
  • 人間の実際の選択集合がロボットの仮定された集合の真の部分集合である場合、特に人間の選択がロボットの拡張された集合内で非最適である場合、ロボットの報酬パrameter に関する信念が著しく歪められる。
  • 誤設定は、場合によっては過信(例:ロボットの選択集合に多数の非最適オプションが含まれる場合)を引き起こし、他の場合には過小評価(underconfidence)を引き起こす。これは誤設定のクラスに依存する。
  • 実験結果から、人間の選択集合にロボットの集合に含まれないオプションが含まれ、最適なフィードバックがロボットの集合にはあるが人間の集合にはないクラス B3 では、ロボットは真の報酬とは逆に最大化する報酬を推定することが判明した。
  • 本研究は、人間の選択集合よりも大きいロボットの選択集合を設計することで(クラス A2 を好むことで)、より穏やかな誤設定を実現でき、深刻な推論誤差のリスクを低減できると示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。