Skip to main content
QUICK REVIEW

[論文レビュー] VER: Scaling On-Policy RL Leads to the Emergence of Navigation in Embodied Rearrangement

Erik Wijmans, Irfan Essa|arXiv (Cornell University)|Oct 11, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

この論文は、環境のシミュレーション速度のばらつきに応じてロールアウト長を動的に調整することで、非同期処理の遅延を回避しながら、複数のGPUで高スループットのオンポリシー学習を実現する、新しいオンポリシー強化学習手法であるVariable Experience Rollout (VER)を紹介する。VERは、DD-PPO や SampleFactory といった最先端の手法と比較して1.6倍~2.7倍の高速化を達成しながらも、サンプル効率を維持または向上させ、エムベデッドリアレンジメントタスクにおけるピックアンドプレースなど、ナビゲーションが不要なタスクでも驚くべきナビゲーションの出現を実現する。

ABSTRACT

We present Variable Experience Rollout (VER), a technique for efficiently scaling batched on-policy reinforcement learning in heterogenous environments (where different environments take vastly different times to generate rollouts) to many GPUs residing on, potentially, many machines. VER combines the strengths of and blurs the line between synchronous and asynchronous on-policy RL methods (SyncOnRL and AsyncOnRL, respectively). VER learns from on-policy experience (like SyncOnRL) and has no synchronization points (like AsyncOnRL). VER leads to significant and consistent speed-ups across a broad range of embodied navigation and mobile manipulation tasks in photorealistic 3D simulation environments. Specifically, for PointGoal navigation and ObjectGoal navigation in Habitat 1.0, VER is 60-100% faster (1.6-2x speedup) than DD-PPO, the current state of art distributed SyncOnRL, with similar sample efficiency. For mobile manipulation tasks (open fridge/cabinet, pick/place objects) in Habitat 2.0 VER is 150% faster (2.5x speedup) on 1 GPU and 170% faster (2.7x speedup) on 8 GPUs than DD-PPO. Compared to SampleFactory (the current state-of-the-art AsyncOnRL), VER matches its speed on 1 GPU, and is 70% faster (1.7x speedup) on 8 GPUs with better sample efficiency. We leverage these speed-ups to train chained skills for GeometricGoal rearrangement tasks in the Home Assistant Benchmark (HAB). We find a surprising emergence of navigation in skills that do not ostensible require any navigation. Specifically, the Pick skill involves a robot picking an object from a table. During training the robot was always spawned close to the table and never needed to navigate. However, we find that if base movement is part of the action space, the robot learns to navigate then pick an object in new environments with 50% success, demonstrating surprisingly high out-of-distribution generalization.

研究の動機と目的

  • エムベデッドAIにおけるオンポリシー強化学習のスループットとサンプル効率のトレードオフを解消すること。
  • 異なるシミュレーション速度を持つ非均質的で複数GPUを用いたバッチオンポリシー学習において、ストラグルラー効果を排除すること。
  • オンポリシーデータの品質とサンプル効率を維持したまま、多数のGPUへの効率的スケーリングを可能にすること。
  • ナビゲーション行動をナビゲーションを必要としないタスクに組み込むことで、顕在的ナビゲーションポリシーが出現するか、および一般化性能が向上するかを検証すること。
  • HABのような挑戦的なエムベデッドリアレンジメントベンチマークで、VERの有効性を示すこと。

提案手法

  • VERは、シミュレーション速度に応じて各環境ごとのロールアウトステップ数を動的に調整し、速い環境から多くの経験を収集し、遅い環境からは少ない経験を収集する。
  • 同期型手法のオンポリシー学習と非同期型手法の同期ポイントの欠如を組み合わせ、遅延のないストラグルラー効果を回避しながらデータ品質を保持する。
  • 分散型の非中央集権的トレーニングフレームワークを用いて、複数GPUに効率的にスケーリングし、経験収集とポリシー更新を重ね合わせる。
  • 可変長ロールアウトを活用してオンポリシーデータを維持し、同期のボトルネックが生じない高サンプル効率を実現する。
  • Habitat などの既存シミュレータと統合可能で、最小限のアーキテクチャ変更で複数環境バッチ処理をサポートする。
  • 学習と経験収集を重ねることで、計算リソースの利用効率とスループットを向上させる。

実験結果

リサーチクエスチョン

  • RQ1非均質的で複数GPUを用いた環境において、サンプル効率を損なわずにオンポリシーRLを効率的にスケーリングできるか?
  • RQ2各環境ごとにロールアウト長を動的に調整することで、オンポリシー学習におけるストラグルラー効果が排除できるか?
  • RQ3ナビゲーションを必要としないタスクにナビゲーション行動を組み込むことで、顕在的ナビゲーションポリシーが出現するか?
  • RQ4DD-PPO や SampleFactory といった最先端のオンポリシー手法と比較して、VERの速度とサンプル効率はどの程度か?
  • RQ5顕在的ナビゲーションは、HAB などの複雑なエムベデッドリアレンジメントベンチマークでの性能向上に寄与するか?

主な発見

  • Habitat 1.0 の PointGoal および ObjectGoal ナビゲーションタスクにおいて、VERはDD-PPOより60%~100%高速(1.6~2倍の高速化)であり、サンプル効率は同等である。
  • Habitat 2.0 のモバイルマニピュレーションタスクにおいて、VERは1GPUで150%高速(2.5倍の高速化)、8GPUで170%高速(2.7倍の高速化)であり、DD-PPO よりも高速である。
  • 8GPU環境では、VERはSampleFactory より70%高速(1.7倍の高速化)であり、サンプル効率も優れている。また、1スキルあたり11.2GPU日を節約する。
  • PointNavではVERはDD-PPO より19.2GPU日、ObjectNavでは28GPU日を節約する。
  • Home Assistant Benchmark (HAB) において、VERで学習したエージェントはTidy Houseタスクで30%の成功率向上を示し、分布外一般化性能が向上している。
  • 驚くべきことに、ナビゲーションを必要としないピックスキルが、基本的な移動機能を有効化した場合、新しい環境で50%の成功率でナビゲーションを学習するようになる。これは顕在的ナビゲーションの出現を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。