[論文レビュー] Few-Shot Preference Learning for Human-in-the-Loop RL
本論文では、メタラーニングを活用してマルチタスクデータ上で報酬モデルを事前学習することで、人間のフィードバッククエリを数個にまで制限した、人間を含む強化学習における少数ショットの好み学習手法を提案する。この手法により、Meta-Worldではオンラインでのフィードバック要件を20倍削減でき、Franka Pandaロボット上で実際の人間ユーザーからのフィードバックを用いてポリシーを訓練可能となる。
While reinforcement learning (RL) has become a more popular approach for robotics, designing sufficiently informative reward functions for complex tasks has proven to be extremely difficult due their inability to capture human intent and policy exploitation. Preference based RL algorithms seek to overcome these challenges by directly learning reward functions from human feedback. Unfortunately, prior work either requires an unreasonable number of queries implausible for any human to answer or overly restricts the class of reward functions to guarantee the elicitation of the most informative queries, resulting in models that are insufficiently expressive for realistic robotics tasks. Contrary to most works that focus on query selection to \emph{minimize} the amount of data required for learning reward functions, we take an opposite approach: \emph{expanding} the pool of available data by viewing human-in-the-loop RL through the more flexible lens of multi-task learning. Motivated by the success of meta-learning, we pre-train preference models on prior task data and quickly adapt them for new tasks using only a handful of queries. Empirically, we reduce the amount of online feedback needed to train manipulation policies in Meta-World by 20$ imes$, and demonstrate the effectiveness of our method on a real Franka Panda Robot. Moreover, this reduction in query-complexity allows us to train robot policies from actual human users. Videos of our results and code can be found at https://sites.google.com/view/few-shot-preference-rl/home.
研究の動機と目的
- 複雑なロボットタスクにおける密度的で意図に整合した報酬関数を設計する課題に取り組むこと。これらの報酬関数は手動で設計することが困難である。
- 従来の好みベースの強化学習手法が過剰な人間のクエリを必要としたり、報酬関数の表現力に制限があるという限界を克服すること。
- 事前に存在するマルチタスクデータを活用して、新しいタスクへの適応を加速させることで、効率的でデータが乏しいポリシー訓練を実現すること。
- シミュレーションおよび現実世界のロボット環境において、実際の人間のフィードバックから操作ポリシーを学習する可能性を実証すること。
提案手法
- 多数のロボット操作タスクにわたる大規模なデータセット上で事前学習することで、複数のロボット操作タスク間で共通する報酬構造を学習する好みモデルを構築する。
- 新しいタスクに対して、わずか数個のヒューマン提供のペアワイズ比較(例:「どの軌道がより良いですか?」)を用いて、事前学習済みモデルをファインチューニングする。
- メタラーニング(特にMAML)を用いて、最小限の勾配更新で新しいタスクに素早く適応できるようにモデルの能力を最適化する。
- 適応した報酬モデルをSACベースの強化学習フレームワークに適用し、オンラインでの人間のフィードバックを最小限に抑えてポリシーを訓練する。
- 初期段階では一様サンプリングを用いた固定フィードバックスケジュールを採用し、後続段階では不確実性や不一致に基づいたクエリ選択を実施する。
- エキスパートのデモンストレーションや再ラベル付けされた状態からの軌道セグメントを活用し、人間のラベリングに役立つ情報豊富な比較クエリを生成する。
実験結果
リサーチクエスチョン
- RQ1マルチタスクデータに対する事前学習が、新しいロボットタスクの高パフォーマンスな報酬関数を学習するためのヒューマンフィードバッククエリ数を著しく削減できるか?
- RQ2メタラーニングは、標準的なファインチューニングやクエリ選択戦略と比較して、好みモデルの新しいタスクへの適応速度を向上させられるか?
- RQ3提案手法は、シミュレーションおよび現実世界のロボット環境において、実際の人間のフィードバックから効果的なロボットポリシーを学習可能か?
- RQ4クエリ効率性および最終的なポリシー性能の観点から、最先端のアクティブ好み学習ベースラインと比較して、本手法はどのように差をつけるか?
主な発見
- 本手法は、Meta-Worldベンチマークにおいて、従来の最先端手法と比較して、必要なヒューマンフィードバッククエリ数を20倍削減した。
- 本手法は、従来の手法が高コストなクエリ要件のため達成できなかったように、実際の人間のフィードバックを用いて操作ポリシーを訓練可能とした。
- Franka Pandaロボットでは、現実世界の設定でたった200件のヒューマンフィードバッククエリのみで、到達・プッシュポリシーを正常に訓練できた。
- 少数ショット手法は、PEBBLEなどのベースラインと比較して、より情報量の多いクエリを選択しており、ユーザーが提案手法が生成する比較オプションを一貫して好むことが実証された。
- ヒューマン評価では、明確な視覚的差異(例:閉じたドア対開いたドア)のおかげで、本手法のクエリは回答がより簡単であり、ラベリング効率が向上した。
- Meta-Worldの複数のタスク(Window CloseやDoor Closeを含む)において、本手法はRCEおよびPEBBLEを上回り、サンプル効率性および最終的なポリシー性能の両面で優れた結果を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。