Skip to main content
QUICK REVIEW

[論文レビュー] Inverse Preference Learning: Preference-based RL without a Reward Function

Joey Hejna, Dorsa Sadigh|arXiv (Cornell University)|May 24, 2023
Advanced Graph Neural Networks被引用数 6
ひとこと要約

本稿では、人間の好みに一致するQ関数を直接最適化することで、明示的な報酬関数学習を回避するパラメータ効率の良いオフライン強化学習アルゴリズムである逆好み学習(IPL)を紹介する。逆ソフトベルマン作用素を活用することで、Transformerなどの複雑な報酬モデルを用いる最先端手法と比較して、より少ないパラメータ数およびハイパーパramータ数でロボット工学ベンチマークで競争力ある性能を達成する。

ABSTRACT

Reward functions are difficult to design and often hard to align with human intent. Preference-based Reinforcement Learning (RL) algorithms address these problems by learning reward functions from human feedback. However, the majority of preference-based RL methods naïvely combine supervised reward models with off-the-shelf RL algorithms. Contemporary approaches have sought to improve performance and query complexity by using larger and more complex reward architectures such as transformers. Instead of using highly complex architectures, we develop a new and parameter-efficient algorithm, Inverse Preference Learning (IPL), specifically designed for learning from offline preference data. Our key insight is that for a fixed policy, the $Q$-function encodes all information about the reward function, effectively making them interchangeable. Using this insight, we completely eliminate the need for a learned reward function. Our resulting algorithm is simpler and more parameter-efficient. Across a suite of continuous control and robotics benchmarks, IPL attains competitive performance compared to more complex approaches that leverage transformer-based and non-Markovian reward functions while having fewer algorithmic hyperparameters and learned network parameters. Our code is publicly released.

研究の動機と目的

  • 学習された報酬関数に依存する既存の好みベースRL手法の高い複雑さとハイパーパramータ感受性を解消すること。
  • 別個の報酬ネットワークを必要としないため、オフラインRLにおける計算的・アーキテクチャ的オーバーヘッドを低減すること。
  • 連続制御およびロボット工学タスクで性能を維持しつつ、サンプルおよびパラメータ効率を向上させること。
  • 固定方策下でQ関数のみが、効果的な好み整合性を実現するのに十分な報酬情報を持つ可能性を検証すること。
  • 別個の報酬モデル学習を含む二段階的手法よりも、より安定的かつ調整が容易な手法を開発すること。

提案手法

  • IPLは、固定方策下でQ関数を逆ソフトベルマン作用素を用いて暗黙の報酬関数に再構築することで、好みベース最適化を直接可能にする。
  • アルゴリズムはQ関数を最適Q*と一致させるとともに、暗黙の報酬が専門家の好みデータと整合的であることを保証する。
  • ハイパーパramータλを用いた正則化項により、好みに整合するQ値からの逸脱をペナルティ化し、別個の報酬モデルを用いずに学習を安定化させる。
  • IPLはオフライン強化学習フレームワーク内に完全に統合されており、IQLやAWACなどのオフポリシー手法を用い、別個の報酬ネットワークの学習を回避する。
  • 固定方策下ではQ関数が報酬関数を再構築するのに必要なすべての情報を含んでいるという事実を活用する。
  • 最適Q値と好み整合性の両方を同時に最適化する単一段階の学習手順を採用し、誤差伝搬を低減する。

実験結果

リサーチクエスチョン

  • RQ1明示的な報酬モデルが存在しない状況でも、Q関数のみで好みベースRLにおいて競争力ある性能を達成できるか?
  • RQ2報酬ネットワークを排除することでハイパーパramータ感受性が低減し、学習の安定性が向上するか?
  • RQ3TransformerやRNNを用いた報酬モデルを用いる最先端手法と比較して、IPLのパラメータ効率はどの程度か?
  • RQ4正則化強度λの選択がIPLの性能にどの程度影響を及えるか?
  • RQ5明示的な報酬関数学習なしに、IPLは多様なロボット工学ベンチマークに一般化可能か?

主な発見

  • IPLは報酬関数を学習しない状態でも、マーカイオニアン報酬モデルを用いたIQLと同等またはそれ以上の性能を達成する。
  • ドア開閉タスクでは、64次元MLPを用いたIPLが、35次元MLPベースの報酬モデルであるMR(35)を上回る性能を示したが、パラメータ数ははるかに少ない。
  • 報酬予測からの誤差伝搬が低減されているため、報酬モデルに依存する手法と比較して、IPLは実行間の分散が著しく小さい。
  • 最小限のパラメータ予算(14kパラメータ)でも、最大10倍のパラメータを要する標準的な好みベースRLベースラインを上回る性能を達成する。
  • IPLの性能はハイパーパramータλの変更に対してほとんど感受性がなく、ハイパーパramータチューニングに対して高いロバスト性を示す。
  • MRモデルは学習ステップ数が不足するとアンダーフィットし、多すぎるとオーバーフィットするが、IPLは単一段階のエンドツーエンド最適化により、このトレードオフを回避する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。