Skip to main content
QUICK REVIEW

[論文レビュー] SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning

Jongjin Park, Younggyo Seo|arXiv (Cornell University)|Mar 18, 2022
Reinforcement Learning in Robotics被引用数 14
ひとこと要約

SURFは、ラベルなしデモと新しい時系列クロッピングデータ拡張技術を活用することで、選好ベース強化学習におけるフィードバック効率を向上させる半教師付き報酬学習フレームワークを提案する。この手法は、数100件の選好クエリのみで複雑なロボット操作タスクにおいてほぼ最適な性能を達成し、低フィードバック設定下でベースライン手法を著しく上回る。

ABSTRACT

Preference-based reinforcement learning (RL) has shown potential for teaching agents to perform the target tasks without a costly, pre-defined reward function by learning the reward with a supervisor's preference between the two agent behaviors. However, preference-based learning often requires a large amount of human feedback, making it difficult to apply this approach to various applications. This data-efficiency problem, on the other hand, has been typically addressed by using unlabeled samples or data augmentation techniques in the context of supervised learning. Motivated by the recent success of these approaches, we present SURF, a semi-supervised reward learning framework that utilizes a large amount of unlabeled samples with data augmentation. In order to leverage unlabeled samples for reward learning, we infer pseudo-labels of the unlabeled samples based on the confidence of the preference predictor. To further improve the label-efficiency of reward learning, we introduce a new data augmentation that temporally crops consecutive subsequences from the original behaviors. Our experiments demonstrate that our approach significantly improves the feedback-efficiency of the state-of-the-art preference-based method on a variety of locomotion and robotic manipulation tasks.

研究の動機と目的

  • 複雑なタスクへの適用を制限する、選好ベース強化学習における高い人間のフィードバックコストを低減すること。
  • リプレイバッファに保存された無制限のラベルなしデモを活用して、サンプル効率を向上させること。
  • エージェントの軌道から連続する部分列をクロッピングする新しいデータ拡張法により、一貫性を強制することで報酬一般化を向上させること。
  • ピクセル観測などの高次元的で部分的に観測可能な入力からの有効な学習を可能にすること。

提案手法

  • 訓練済みの選好予測子の信頼度に基づいて、ラベルなしデモに対して人工的な選好ラベルを生成するための擬似ラベル付けを用いる。
  • 完全な軌道からわずかにずらされた、またはリサイズされた部分列を生成する時系列クロッピング拡張を導入し、それらが同じ選好を保持すると仮定する。
  • ラベル付き選好データと擬似ラベル付きラベルなしデータの両方を組み合わせた重み付き損失目的関数を用いて報酬モデルを訓練する。
  • 元のビューと拡張ビューの間で報酬予測の差を最小化することで、両ビュー間の一貫性を強制する。
  • 既存の手法(例:PEBBLE)と統合可能な選好ベースRLパイプラインに、エンドツーエンドでフレームワークを適用する。
  • ラベルなしバッチ比、擬似ラベル付けの信頼度しきい値、教師ありと自己教師ありの目的関数間の損失重みのハイパーパrameterチューニングを行う。

実験結果

リサーチクエスチョン

  • RQ1リプレイバッファに保存されたラベルなしデモが、選好ベースRLにおけるフィードバック効率の向上に有効に活用可能か?
  • RQ2新しい時系列クロッピングデータ拡張戦略が報酬一般化を向上させ、必要な人間の選好クエリ数を削減できるか?
  • RQ3半教師付き学習とデータ拡張の組み合わせが、高次元的で部分的に観測可能な制御タスクにおける性能に与える影響は何か?
  • RQ4SURFは、複雑なロボット操作および歩行タスクで高い性能を達成するために必要なフィードバック予算をどの程度低減できるか?

主な発見

  • SURFは、Meta-Worldの複雑なロボット操作タスクにおいて、200件の選好クエリのみで約100%の成功率を達成したのに対し、ベースライン手法は同じ条件下で約50%にとどまった。
  • ピクセル観測に基づく歩行タスクでは、SURFは200件の選好クエリで、真値報酬を用いた強力なベースライン(DrQ-v2)と同等の性能を達成した。
  • ラベルなしバッチ比や信頼度しきい値の変動に対しては頑健であるが、非常に高いバッチサイズや低いしきい値では性能がわずかに低下した。
  • 損失重みλのハイパーパrameterチューニングが最も顕著な性能向上をもたらし、これが教師ありと自己教師あり学習のバランスをとる上で極めて重要な役割を果たしていることを示している。
  • SURFはDeepMind Control SuiteおよびMeta-Worldの多様なタスクにおいてフィードバック効率を向上させ、特定の環境を超えた一般化能力を示した。
  • フレームワークは画像入力と互換性があり、既存の画像拡張技術とも組み合わせ可能であるため、さらなる性能向上の可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。