Skip to main content
QUICK REVIEW

[論文レビュー] Models of human preference for learning reward functions

W. Bradley Knox, Stephane Hatgis-Kessell|arXiv (Cornell University)|Jun 5, 2022
Mental Health Research Topics被引用数 8
ひとこと要約

本稿は、逆強化学習における報酬関数学習のためのレジットベースの好みモデルを提案し、人間の好みは部分的報酬(セグメント内の報酬の合計)よりも最適行動からの逸脱(レジット)によってよりよく説明されると主張する。無限の好みがある条件下でレジットモデルの同定可能性を証明し、実験的に、人間の好みの予測、ポリシー性能、人間の価値観との整合性において、標準的な部分的報酬モデルを上回ることを示した。

ABSTRACT

The utility of reinforcement learning is limited by the alignment of reward functions with the interests of human stakeholders. One promising method for alignment is to learn the reward function from human-generated preferences between pairs of trajectory segments, a type of reinforcement learning from human feedback (RLHF). These human preferences are typically assumed to be informed solely by partial return, the sum of rewards along each segment. We find this assumption to be flawed and propose modeling human preferences instead as informed by each segment's regret, a measure of a segment's deviation from optimal decision-making. Given infinitely many preferences generated according to regret, we prove that we can identify a reward function equivalent to the reward function that generated those preferences, and we prove that the previous partial return model lacks this identifiability property in multiple contexts. We empirically show that our proposed regret preference model outperforms the partial return preference model with finite training data in otherwise the same setting. Additionally, we find that our proposed regret preference model better predicts real human preferences and also learns reward functions from these preferences that lead to policies that are better human-aligned. Overall, this work establishes that the choice of preference model is impactful, and our proposed regret preference model provides an improvement upon a core assumption of recent research. We have open sourced our experimental code, the human preferences dataset we gathered, and our training and preference elicitation interfaces for gathering a such a dataset.

研究の動機と目的

  • 現在の逆強化学習手法が、人間の好みが部分的報酬(セグメント内の報酬の合計)にのみ依存すると仮定しているという限界に対処すること。
  • 最適意思決定からの逸脱を測るレジットに基づいた代替好みモデルを提案し、人間の好みのより正確な表現とすること。
  • 無限の好みがある条件下で、レジットモデルが真の報酬関数を一意に同定できることを理論的に証明すること。部分的報酬モデルとは異なり、複数の理論的文脈で同定不能である。
  • 実験的に、レジットモデルが本物の人間の好みを予測し、より整合性の高いポリシーを学習する優位性を検証すること。

提案手法

  • レジットを、最適方策に対する各遷移のアドバンテージの合計の負の値として定義する(軌道セグメント内)。
  • 好みの確率が各セグメントの部分的報酬ではなく、レジットに依存する好みモデルを定式化する。
  • 無限でノイズのない好みがある場合、レジットモデルは真の報酬関数を一意に同定可能であることを証明する。一方、部分的報酬モデルは複数の理論的文脈で同定不能である。
  • 豊かなグリッドワールド環境で人間がラベル付けした好みデータセットを収集し、モデルの性能を比較する。
  • レジットモデルと部分的報酬モデルの両方を用いて好み学習による報酬関数を訓練し、正規化された平均報酬を用いてポリシーを評価する。
  • 早期に終了するセグメントの削除を含むアブレーションスタディと、同じ真の報酬関数を持つ100のMDPにわたる一般化テストを実施する。

実験結果

リサーチクエスチョン

  • RQ1部分的報酬ではなくレジットによって人間の好みをモデル化することで、理論的に真の報酬関数の同定性が向上するか?
  • RQ2部分的報酬モデルと比較して、レジットベースの好みモデルは本物の人間の好みをどれほど正確に予測できるか?
  • RQ3レジット好みモデルを用いて学習したポリシーは、人間の価値観に整合した性能で部分的報酬モデルを上回るか?
  • RQ4同じ基礎となる報酬関数を持つ異なるMDPのインスタンス間で、レジットモデルは部分的報酬モデルよりも一般化性能が優れているか?
  • RQ5部分的報酬モデルが真の報酬関数を同定できないのは、報酬関数のシフトやセグメント長の変動といった構造的問題によるものか?

主な発見

  • 最初の段階の人間好みデータにおいて、レジットモデルは正規化された平均報酬0.999を達成した一方、部分的報酬モデルは-12.7を記録し、近似的に最適な性能と著しく劣る性能を示した。
  • 人間ラベル付きデータセットのすべてのパーティションにおいて、レジットモデルは部分的報酬モデルを上回り、特に近似的に最適な性能とランダムより優れた性能の閾値で顕著に優れた予測性能を示した。
  • 同じ真の報酬関数を持つ100のMDPにわたる一般化テストにおいて、レジットモデルは部分的報酬モデルよりも一貫して近似的に最適な性能を達成しており、特に20および5つのトレーニングパーティションで顕著であった。
  • 変動する長さの軌道や単一遷移セグメントを含む文脈では、部分的報酬モデルは真の報酬関数を同定できないが、レジットモデルは依然として同定可能である。
  • トレーニングデータから早期に終了するセグメントを削除しても、レジットモデルの性能は依然として頑健であり、部分的報酬モデルの劣悪な性能はデータ固有のアーチファクトではなく、構造的欠陥によるものであることが確認された。
  • 一般化性能において、モデル間で統計的に有意な差は認められなかった(p > 0.2)。しかし、近似的に最適なポリシー回復の頻度という観点では、常にレジットモデルが部分的報酬モデルを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。