[論文レビュー] Learning Dexterous Manipulation from Suboptimal Experts
本論文は、高次元のロボット操作タスクにおける、極めて非政策的(off-policy)な専門家データと、オンポリシー探索を効果的に組み合わせる相対エントロピーQ学習(REQ)を導入する。重要度サンプリングを用いた学習済み事前分布とKL制約を組み合わせることで、REQは非政策的学習、オフライン学習、模倣学習の設定において強力なベースラインを上回り、道筋制御や学習されたプリミティブから構成される劣化した専門家データからのサンプル効率の良い学習を可能にする。
Learning dexterous manipulation in high-dimensional state-action spaces is an important open challenge with exploration presenting a major bottleneck. Although in many cases the learning process could be guided by demonstrations or other suboptimal experts, current RL algorithms for continuous action spaces often fail to effectively utilize combinations of highly off-policy expert data and on-policy exploration data. As a solution, we introduce Relative Entropy Q-Learning (REQ), a simple policy iteration algorithm that combines ideas from successful offline and conventional RL algorithms. It represents the optimal policy via importance sampling from a learned prior and is well-suited to take advantage of mixed data distributions. We demonstrate experimentally that REQ outperforms several strong baselines on robotic manipulation tasks for which suboptimal experts are available. We show how suboptimal experts can be constructed effectively by composing simple waypoint tracking controllers, and we also show how learned primitives can be combined with waypoint controllers to obtain reference behaviors to bootstrap a complex manipulation task on a simulated bimanual robot with human-like hands. Finally, we show that REQ is also effective for general off-policy RL, offline RL, and RL from demonstrations. Videos and further materials are available at sites.google.com/view/rlfse.
研究の動機と目的
- スパarsな報酬と限られた探索が伴う高次元のロボット操作タスクにおけるサンプル効率の課題に対処すること。
- 劣化した専門家とオンポリシーのロールアウトから得られる混合データ分布を効果的に活用できる統一的な強化学習アルゴリズムを開発すること。
- 複雑なタスクに対して、学習されたプリミティブとウェイポイントコントローラーの組み合わせによって劣化した専門家を構築できることを示すこと。
- 専門家行動とポリシー行動を入り交ぜることで、困難な操作環境における豊富な探索が可能になること。
- REQの有効性を、非政策的強化学習、オフライン強化学習、模倣学習の設定において、タスク固有のチューニングなしに検証すること。
提案手法
- REQは、学習済み事前ポリシーに対するKLダイバージェンス制約のもとでポリシーを最適化するポリシー反復アルゴリズムである。
- 混合データセット(非政策的専門家データとオンポリシーのロールアウト)からのQ値推定に重要度サンプリングを用いる。
- アルゴリズムは、KL正則化によって事前ポリシーに近づくように保証しつつ、期待Q値を最大化するようにポリシーを更新する。
- 劣化した専門家は、高レベルの運動シーケンスのためのウェイポイント追従コントローラーと、機敏な操作のための学習されたプリミティブの組み合わせによって構築される。
- 探索のための入り交ぜられた戦略は、ロールアウト中にポリシーの行動と専門家の行動を交互に入れ替えることで実装され、状態カバレッジが向上する。
- 本手法は、DeepMind Control SuiteとシミュレーテッドShadow Handを用いたバイマンジュアルLEGO積み木タスクで評価された。
実験結果
リサーチクエスチョン
- RQ11つの強化学習アルゴリズムが、高次元制御タスクにおけるサンプル効率を向上させるために、極めて非政策的専門家データとオンポリシー探索を効果的に統合できるか?
- RQ2複雑な機敏な操作タスクに対して、モジュラで直感的な方法で劣化した専門家を構築できるか?
- RQ3専門家行動とポリシー行動を入り交ぜることで、標準的な探索戦略に比べてより良い探索と高速な収束が達成できるか?
- RQ4REQは、タスク固有のチューニングなしに、非政策的学習、オフライン学習、模倣学習の設定に一般化できるか?
- RQ5組み合わせた専門家(プリミティブ+コントローラー)が、複雑な操作タスクの学習をどの程度効果的にブートストラップできるか?
主な発見
- REQは、DeepMind Control SuiteにおいてD4PG、CRR、行動クラーニングなどの強力なベースラインを上回り、9つのタスクのうち6つで最高の報酬を達成した。
- バイマンジュアルLEGO積み木タスクという挑戦的なタスクにおいて、REQfSEは劣化した専門家の性能を上回るポリシーを学習し、組み合わせられた行動からの有効なブートストラップを示した。
- オフライン強化学習において、REQは最先端のパフォーマンスを達成し、Cartpoleでは860±7、Walker Standでは929±46、Fish Swimでは592±41の報酬を記録した。
- 入り交ぜた探索戦略の使用は、サンプル効率を著しく向上させ、標準的な探索戦略が失敗する環境でも学習を可能にした。
- REQは強力な一般化性能を示し、アーキテクチャやハイパーパrameterの変更なしに、非政策的学習、オフライン学習、模倣学習のベンチマークで競争力のある性能を発揮した。
- 学習されたプリミティブとウェイポイントコントローラーから構成される劣化専門家は、効果的なタスク分解を可能にし、複雑で高次元のタスクにおけるポリシー学習に成功した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。