[論文レビュー] PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training
PEBBLEは、経験の再ラベル化を通じて自己教師付き事前学習とオフポリシー学習を組み合わせることで、人間のフィードバックとサンプルの要件を削減するフィードバック効率の良いインタラクティブ強化学習フレームワークを導入する。エージェントを多様な行動を探索するように事前学習し、報酬モデルが更新されるたびに過去の経験を再ラベルすることで、スパarsな報酬を用いた教師付き強化学習と同等の性能を達成し、複雑な歩行や操作タスクを最小限の人の好みのフィードバックで実現可能にする。
Conveying complex objectives to reinforcement learning (RL) agents can often be difficult, involving meticulous design of reward functions that are sufficiently informative yet easy enough to provide. Human-in-the-loop RL methods allow practitioners to instead interactively teach agents through tailored feedback; however, such approaches have been challenging to scale since human feedback is very expensive. In this work, we aim to make this process more sample- and feedback-efficient. We present an off-policy, interactive RL algorithm that capitalizes on the strengths of both feedback and off-policy learning. Specifically, we learn a reward model by actively querying a teacher's preferences between two clips of behavior and use it to train an agent. To enable off-policy learning, we relabel all the agent's past experience when its reward model changes. We additionally show that pre-training our agents with unsupervised exploration substantially increases the mileage of its queries. We demonstrate that our approach is capable of learning tasks of higher complexity than previously considered by human-in-the-loop methods, including a variety of locomotion and robotic manipulation skills. We also show that our method is able to utilize real-time human feedback to effectively prevent reward exploitation and learn new behaviors that are difficult to specify with standard reward functions.
研究の動機と目的
- インタラクティブ強化学習における人的フィードバックの高コストを削減するため、フィードバック効率とサンプル効率を向上させること。
- 歩行や操作といった複雑なロボット行動を、人の好み比較の数を最小限に抑えて学習可能にする。
- 人間が介入して不適切な行動を是正できる仕組みを導入し、報酬の過剰適合を軽減すること。
- 自己教師付き事前学習とオフポリシー学習を組み合わせ、収集した経験の再利用を最大化し、リアルタイムでの人的入力を最小限に抑えること。
提案手法
- エージェントは、内在的欲求を用いて自己教師付き事前学習を実施し、多様な状態を探索し、一貫性があり多様な行動を生成する。
- 人間のフィードバックは、エージェント行動の2つのクリップ間の2値的好みとして収集され、報酬モデルの学習に使用される。
- 報酬モデルが更新されるたびに、すべての過去の経験が更新された報酬モデルに基づいて再ラベルされ、オフポリシー学習が可能になり、データ効率が最大化される。
- 学習された報酬モデルに基づく期待報酬を最大化するように、オフポリシー強化学習(例:SAC)を用いてポリシーを更新する。
- 不確実性に基づくサンプリング(不一致またはエントロピー)を用いて、人的フィードバックに有用な行動クリップを選択し、学習効率を向上させる。
- 本手法は、Walker, Cheetah, Quadruped, Hopper, CartPoleを含むMuJoCoの連続的制御タスクに適用され、現実の人的フィードバックが使用された。
実験結果
リサーチクエスチョン
- RQ1自己教師付き事前学習は、インタラクティブ強化学習における人的フィードバックの質と情報性を向上させることができるか?
- RQ2経験の再ラベル化を伴うオフポリシー学習は、人的フィードバックのクエリ数を顕著に削減できるか?
- RQ3PEBBLEは、エンジニアリングされた報酬関数では指定が難しい、例えばバックフリップや脚の振る舞いといった複雑なロボット行動を学習できるか?
- RQ4標準的な強化学習に手作業で設計された報酬を用いる場合と比較して、PEBBLEは報酬の過剰適合を効果的に回避し、より自然で人のような行動を実現できるか?
主な発見
- PEBBLEは、Quadruped-walkやHopper-backflipを含む全タスクで、真のスパarsな報酬を用いたSACと同等の性能を達成したが、フィードバッククエリ数はわずか1400回にとどまった。
- Quadruped-walkタスクにおいて、同じフィードバッククエリ数を用いても、Preference PPOを上回る性能を示し、フィードバック効率の優位性を実証した。
- 長い行動クリップ(例:10ステップのセグメント)に対する人的フィードバックは、ステップ単位のフィードバックよりも意味のある指導を提供し、より速く安定した学習をもたらした。
- 自己教師付き事前学習は、漸近的性能とサンプル効率を顕著に向上させた。これは、教師が多様で一貫性のある行動に対してより情報量の多いフィードバックを提供可能にしたためである。
- PEBBLEは、わずか50~200件の人的フィードバックで、ポールスイング、フロントレッグの振る舞い、バックフリップといった新しい行動をエージェントが学習した。
- Walker環境では、SACが片方の脚のみで歩行するという報酬の過剰適合を示していたが、200件の人的フィードバックを用いて、より自然な二本足歩行へとエージェントを誘導した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。