[論文レビュー] Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning
GuDAは、タスクの完了に向けて進行する軌道セグメントを選択するためにユーザー定義ルールを適用することにより、エキスパート水準のデモンストレーションデータを生成する人間ガイド付きデータ拡張フレームワークである。これは、オフライン強化学習および模倣学習において、ランダムなデータ拡張を著しく上回り、わずか数個の劣化したデモンストレーションからの有効なポリシー学習を可能にした。特に、物理的ロボットサッカーのタスクにおいて、エキスパートポリシーを上回った。
In offline reinforcement learning (RL), an RL agent learns to solve a task using only a fixed dataset of previously collected data. While offline RL has been successful in learning real-world robot control policies, it typically requires large amounts of expert-quality data to learn effective policies that generalize to out-of-distribution states. Unfortunately, such data is often difficult and expensive to acquire in real-world tasks. Several recent works have leveraged data augmentation (DA) to inexpensively generate additional data, but most DA works apply augmentations in a random fashion and ultimately produce highly suboptimal augmented experience. In this work, we propose Guided Data Augmentation (GuDA), a human-guided DA framework that generates expert-quality augmented data. The key insight behind GuDA is that while it may be difficult to demonstrate the sequence of actions required to produce expert data, a user can often easily characterize when an augmented trajectory segment represents progress toward task completion. Thus, a user can restrict the space of possible augmentations to automatically reject suboptimal augmented data. To extract a policy from GuDA, we use off-the-shelf offline reinforcement learning and behavior cloning algorithms. We evaluate GuDA on a physical robot soccer task as well as simulated D4RL navigation tasks, a simulated autonomous driving task, and a simulated soccer task. Empirically, GuDA enables learning given a small initial dataset of potentially suboptimal experience and outperforms a random DA strategy as well as a model-based DA strategy.
研究の動機と目的
- 現実世界のタスクにおいて、高品質なエキスパートデモンストレーションを収集することが費用がかかり、困難であるという課題に対処すること。
- 追加の現実世界のインタラクションを必要とせずに、多様でエキスパートに似たデモンストレーションデータを生成することにより、オフライン強化学習および模倣学習のパフォーマンスを向上させること。
- 最適なエキスパートデモンストレーションに依存するのを減らし、タスクの進行に関する簡単で直感的なルールを用いて、実践者がデータ拡張をガイドできるようにすること。
- 特に複雑な物理的ロボットタスクを含む、シミュレーテッドおよび現実世界の環境において、ガイド付きデータ拡張の有効性を評価すること。
提案手法
- GuDAは、ランダムにサンプリングするのではなく、タスクの完了に向けて意味のある進行を示す軌道セグメントをフィルタリング・生成するために、ユーザー定義ルールのセットを用いる。
- 既存のデモンストレーション軌道に、平行移動、回転、反転などの幾何変換を適用して、新たな多様な軌道を生成する。
- ユーザーは、たとえばゴールに近づくことや正しい方向を向くことといった、タスクに特化した行動に基づいたルールを指定し、生成されたデータがエキスパートの行動に近づくようにする。
- 生成されたデータセットから、市販のオフラインRLおよび行動クラーニングアルゴリズムを活用してポリシーを学習する。
- GuDAは、シミュレーテッドナビゲーション、自動運転、および物理的ロボットサッカー環境を含むタスクに適用された。この中で、1つの劣化したデモンストレーションのみが使用された。
- 成功確率および到達時間の指標を用いて、GuDAをランダムなデータ拡張および拡張なしの条件と比較して評価した。
実験結果
リサーチクエスチョン
- RQ1ユーザーがガイドするデータ拡張は、現実世界のインタラクションを必要とせずに、エキスパート水準のデモンストレーションデータを生成できるか?
- RQ2オフライン強化学習および模倣学習におけるポリシー性能の観点から、ガイド付きデータ拡張はランダムなデータ拡張と比べてどのように異なるか?
- RQ3GuDAは、わずか数個、ひいては劣化したデモンストレーションからのみでも、有効なポリシー学習を可能にするか?
- RQ4GuDAは、拡張データで学習した場合、現実世界の物理的タスクにおいて元のデモンストレイターを上回るか?
主な発見
- 1つの劣化したデモンストレーションを用いた物理的ロボットサッカーのタスクにおいて、GuDAはハードな初期化条件下で7/10の成功率を達成したのに対し、ランダムDAおよびNoDAは0/10であった。
- イージーな初期化条件下では、GuDAは8/10の成功率を達成し、ランダムDA(4/10)およびNoDA(4/10)を著しく上回り、エキスパートの9/10の成功率に並んだ。
- イージーな初期化条件下で、GuDAで学習したポリシーはエキスパートポリシーを上回る速さでスコアを達成した。これは、より高いサンプル効率およびポリシー品質を示している。
- ハードな初期化条件下では、GuDAのポリシーのみが一貫して成功した。一方、エキスパートポリシーはほぼすべての試行で失敗した。これは、GuDAがデモンストレイターを上回ることを示している。
- GuDAが生成したデータは、IQM指標および信頼区間を用いて、ランダムなデータ拡張よりも一般化性能が高く、スコアまでの時間が短くなった。
- 結果として、GuDAは、タスクの進行に焦点を当てた高品質な拡張データを生成することで、最小限の劣化したデモンストレーションからの有効な学習を可能にすることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。