[論文レビュー] Offline Learning from Demonstrations and Unlabeled Experience
本稿では、報酬の付与なしに、専門家による示範とラベルなしのロボット経験を活用して、オフライン強化学習を用いて高性能な方策を学習する、オフライン強化的模倣学習(ORIL)を提案する。まず、専門家データとラベルなしデータの間で対照的学習を用いて報酬関数を学習し、その後、学習した報酬ですべてのデータを再ラベル付けすることで、特に示範データが限られ、低品質なラベルなしデータが増加する状況でも、行動コーディング(BC)を常に上回る性能を発揮する。
Behavior cloning (BC) is often practical for robot learning because it allows a policy to be trained offline without rewards, by supervised learning on expert demonstrations. However, BC does not effectively leverage what we will refer to as unlabeled experience: data of mixed and unknown quality without reward annotations. This unlabeled data can be generated by a variety of sources such as human teleoperation, scripted policies and other agents on the same robot. Towards data-driven offline robot learning that can use this unlabeled experience, we introduce Offline Reinforced Imitation Learning (ORIL). ORIL first learns a reward function by contrasting observations from demonstrator and unlabeled trajectories, then annotates all data with the learned reward, and finally trains an agent via offline reinforcement learning. Across a diverse set of continuous control and simulated robotic manipulation tasks, we show that ORIL consistently outperforms comparable BC agents by effectively leveraging unlabeled experience.
研究の動機と目的
- 専門家による示範とラベルなし、報酬が付与されていない経験しか入手できない状況において、オフラインロボット学習のサンプル効率を改善すること。
- オンライン環境とのインタラクションを必要とせず、劣悪またはタスクに関係のない軌道を含む混合品質のラベルなしデータからも効果的な方策学習を可能にすること。
- ラベルなしデータを用いて報酬モデルと最終的な方策の両方を学習することで、行動コーディングとオフライン強化学習の長所を統合すること。
- 高品質な示範データへの依存度を低下させ、低品質または多様なラベルなしデータに対しても学習プロセスが頑健であるようにすること。
- 示範データが少ない状況でも良好に一般化できるスケーラブルでデータ駆動型のアプローチを構築すること。
提案手法
- 専門家状態とラベルなし状態を区別する対照的損失を用いて報酬関数 $ R_{\psi}(s_t) $ を学習し、$ \mathcal{D}_E $ および $ \mathcal{D}_U $ からサンプリングされた状態のクロスエントロピー損失を最小化する。
- 偽陰性を軽減するために、正例/ラベルなし(PU)学習を採用し、ラベルなしデータに隠れた成功事例が含まれる場合の頑健性を向上させる。
- タスク関連の敵対的模倣学習(TRAIL)を用いて報酬モデルの注目をタスク関連状態に集中させ、一般化性能と性能を向上させる。
- 学習した報酬関数を用いて、示範とラベルなしエピソードの両方の軌道を再ラベル付けし、統一的で報酬ラベルが付与されたデータセットを作成する。
- 最先端のオフラインRLアルゴリズム(例:CRR)を用いて、完全にラベルが付与されたデータセット上でオフライン強化学習を実行し、オンラインロールアウトなしで方策最適化を可能にする。
- 敵対的模倣、PU学習、最新のオフラインRLの要素を統合し、サンプル効率の高いオフライン方策学習のためのスケーラブルでエンドツーエンドの手法を構築する。
実験結果
リサーチクエスチョン
- RQ1報酬信号が存在しない状況で、多様なソースからの混合品質のラベルなしロボット経験を、どのように効果的にオフライン方策学習に活用できるか?
- RQ2専門家データとラベルなしデータを用いた対照的学習で学習した報酬モデルが、標準的な行動コーディングと比較して、十分に一般化可能であり、優れた方策学習を可能にするか?
- RQ3示範データが限られている状況で、ラベルなしデータの量が増加するにつれてORILの性能はどのように変化するか?
- RQ4真の報酬が与えられている最新の手法と同等の性能を達成できるか、訓練中は完全にオフラインかつ報酬なしの状態を維持できるか?
- RQ5PU学習とTRAILの使用が、報酬学習段階における偽陰性および低品質なラベルなしデータへの頑健性をどの程度向上させるか?
主な発見
- ORILは、BCが同じ数の示範データで学習した場合でさえ、多様な連続的制御およびロボット操作タスクで一貫してBCを上回る性能を発揮する。
- ORILの性能は、ラベルなしデータの量が増加するにつれて単調に向上し、スケーラビリティと効果的なデータ利用を示している。
- ラベルなしデータの平均的品質が低い場合でもORILは強固な性能を維持しており、ノイズや劣悪な軌道への耐性があることを示している。
- わずか10件の示範データでのみ、ORILははるかに大きな示範データセットで学習したBCと同等の性能を達成しており、優れたサンプル効率を示している。
- 十分なラベルなしデータが利用可能な場合、ジャコアームを用いたInsertionタスクでORILは専門家レベルの性能を達成するが、BCは同じ条件下で専門家性能に到達できない。
- 本手法はタスク間で良好に一般化され、示範データセットサイズを3〜5エピソードにまで削減しても一貫した向上効果を維持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。