[論文レビュー] Preference Transformer: Modeling Human Preferences using Transformers for RL
この論文では、非マルコフ型報酬の重み付き和を用いて人間の好みをモデル化するトランスフォーマーに基づくアーキテクチャ「Preference Transformer」を提案する。これにより、より正確で時間的意識を持つ報酬推定が可能となり、実際の人間のフィードバックを用いて、Hopperでのダブルバックフリップなど複雑な制御行動の学習において、先行手法を上回る性能を発揮する。また、自己注意機構を用いて軌道内の重要なイベントを自動で同定する。
Preference-based reinforcement learning (RL) provides a framework to train agents using human preferences between two behaviors. However, preference-based RL has been challenging to scale since it requires a large amount of human feedback to learn a reward function aligned with human intent. In this paper, we present Preference Transformer, a neural architecture that models human preferences using transformers. Unlike prior approaches assuming human judgment is based on the Markovian rewards which contribute to the decision equally, we introduce a new preference model based on the weighted sum of non-Markovian rewards. We then design the proposed preference model using a transformer architecture that stacks causal and bidirectional self-attention layers. We demonstrate that Preference Transformer can solve a variety of control tasks using real human preferences, while prior approaches fail to work. We also show that Preference Transformer can induce a well-specified reward and attend to critical events in the trajectory by automatically capturing the temporal dependencies in human decision-making. Code is available on the project website: https://sites.google.com/view/preference-transformer.
研究の動機と目的
- 人間の意思決定における時間的依存性を捉えられないマルコフ型報酬仮定の限界を解消すること。
- 非マルコフ型報酬の重み付き和を用いることで、好みのモデル化を改善し、好みベースの強化学習のスケーラビリティとパフォーマンスを向上させること。
- 自己注意を用いて軌道内の重要なイベントを推定し、適切な重要度重みを割り当てるニューラルアーキテクチャを設計すること。
- 実際の人間のフィードバックを用いて、マルチバックフリップやロボット操作などの複雑な行動をサンプル効率よく学習可能にすること。
提案手法
- 各報酬が軌道内での重要度に応じて動的に重み付けされる、非マルコフ型報酬の重み付き和に基づく新しい好みモデルを提案する。
- 非マルコフ型報酬とその重要度重みを生成するため、スタックされた因果的および双方向自己注意層を備えたトランスフォーマーに基づくアーキテクチャを導入する。
- 軌道セグメントの間で注意を計算し、重要なイベントを同定し、動的重みを割り当てる新しい「好みの自己注意レイヤー」を設計する。
- 人間のペairワイズ比較に一致するように訓練される、非マルコフ型報酬の重み付き和を好み予測子として使用する。
- 各軌道セグメントを処理するためのストリームと、重み付き和による好みスコアを計算するためのもう一つのストリームを備えた二重ストリームアーキテクチャを採用する。
- トランスフォーマーが長距離依存性をモデル化できることを活かし、複雑で時間的に広がった行動におけるより良い責任割り当てを実現する。
実験結果
リサーチクエスチョン
- RQ1マルコフ型仮定と比較して、非マルコフ型報酬モデリングアプローチは、好みベースの強化学習のパフォーマンスを向上させることができるか?
- RQ2トランスフォーマーに基づくアーキテクチャは、人間の意思決定を反映するために、軌道内の異なるイベントに対する重要度重みを効果的に学習できるか?
- RQ3提案手法により、人間の好みフィードバックのみを用いて、ダブルバックフリップのような複雑で長時間にわたる行動をエージェントが学習できるか?
- RQ4モデルが学習した注意重みは、人間の好み判断に影響を与える重要なイベントを特定・強調できるか?
- RQ5多様な制御タスクにわたるサンプル効率性と一般化性能の観点から、このモデルは先行する好みモデリング手法と比較して優れているか?
主な発見
- Preference Transformerは、300件の実際の人間フィードバッククエリのみを用いて、Hopper環境でダブルバックフリップを成功に学習した。一方、マルコフ型報酬関数ではその行動を学習できなかった。
- 本手法は、D4RLナビゲーションおよびロケモーションベンチマーク、およびRobomimicロボット操作タスクにおいて、実際の人間の好みを用いて最先端のパフォーマンスを達成した。
- 好みの自己注意レイヤーで学習された重要度重みは、バックフリップ軌道における離陸および着地フェーズといった重要なイベントを明確に強調しており、人間の注視パターンと整合した。
- 非マルコフ型ダイナミクスやマルチオブジェクティブな目的を持つタスクを含む、多様な制御タスクにおいて、本手法は強靭性と一般化性能を示した。
- 注意マップの可視化分析により、モデルが時間的依存性を捉えており、人間の好みに顕著に影響を与えるイベントに高い重みを割り当てていることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。