Skip to main content
QUICK REVIEW

[논문 리뷰] VER: Scaling On-Policy RL Leads to the Emergence of Navigation in Embodied Rearrangement

Erik Wijmans, Irfan Essa|arXiv (Cornell University)|2022. 10. 11.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 이질적인 환경에서 스트래글러 효과를 제거하기 위해 각 환경당 롤아웃 길이를 동적으로 조정함으로써 다수의 GPU를 통해 고속도, 온정책 강화학습을 가능하게 하는 새로운 온정책 강화학습 방법인 Variable Experience Rollout(VER)을 제안한다. VER는 DD-PPO와 SampleFactory와 같은 최첨단 방법들보다 1.6배에서 2.7배 빠른 성능을 달성하면서도 샘플 효율성을 유지하거나 향상시키며, 특히 몸체 재배치 작업과 같은 태스크에서 요구되지 않는 상황에서도 탐색 행동이 놀랍게 유도되는 현상을 관찰한다.

ABSTRACT

We present Variable Experience Rollout (VER), a technique for efficiently scaling batched on-policy reinforcement learning in heterogenous environments (where different environments take vastly different times to generate rollouts) to many GPUs residing on, potentially, many machines. VER combines the strengths of and blurs the line between synchronous and asynchronous on-policy RL methods (SyncOnRL and AsyncOnRL, respectively). VER learns from on-policy experience (like SyncOnRL) and has no synchronization points (like AsyncOnRL). VER leads to significant and consistent speed-ups across a broad range of embodied navigation and mobile manipulation tasks in photorealistic 3D simulation environments. Specifically, for PointGoal navigation and ObjectGoal navigation in Habitat 1.0, VER is 60-100% faster (1.6-2x speedup) than DD-PPO, the current state of art distributed SyncOnRL, with similar sample efficiency. For mobile manipulation tasks (open fridge/cabinet, pick/place objects) in Habitat 2.0 VER is 150% faster (2.5x speedup) on 1 GPU and 170% faster (2.7x speedup) on 8 GPUs than DD-PPO. Compared to SampleFactory (the current state-of-the-art AsyncOnRL), VER matches its speed on 1 GPU, and is 70% faster (1.7x speedup) on 8 GPUs with better sample efficiency. We leverage these speed-ups to train chained skills for GeometricGoal rearrangement tasks in the Home Assistant Benchmark (HAB). We find a surprising emergence of navigation in skills that do not ostensible require any navigation. Specifically, the Pick skill involves a robot picking an object from a table. During training the robot was always spawned close to the table and never needed to navigate. However, we find that if base movement is part of the action space, the robot learns to navigate then pick an object in new environments with 50% success, demonstrating surprisingly high out-of-distribution generalization.

연구 동기 및 목표

  • 신체 AI를 위한 온정책 강화학습에서 처리량과 샘플 효율성 간의 상충 관계를 해결하기 위해.
  • 다양한 시뮬레이션 속도를 가진 이질적이고 다중 GPU 환경에서 배치 온정책 학습 시 스트래글러 효과를 제거하기 위해.
  • 온정책 데이터 품질과 샘플 효율성을 유지하면서도 많은 GPU로 효율적으로 확장할 수 있도록 하기 위해.
  • 비탐색 태스크에 탐색 행동을 활성화하면 잠재적 탐색 정책이 유도되는지 연구하기 위해.
  • HAB와 같은 도전적인 몸체 재배치 벤치마크에서 VER의 효과성을 입증하기 위해.

제안 방법

  • VER는 시뮬레이션 속도에 따라 각 환경당 롤아웃 스텝 수를 동적으로 조정하여 빠른 환경에서는 더 많은 경험을 수집하고 느린 환경에서는 덜 수집한다.
  • 동기화 방법의 온정책 학습 특성을 유지하면서 이성적 방법의 동기화 지점이 없는 특성을 결합하여 스트래글러 지연을 방지하면서도 데이터 품질을 유지한다.
  • 분산된 분산 학습 아키텍처를 사용하여 여러 GPU에 걸쳐 효율적으로 확장되며, 경험 수집과 정책 업데이트를 겹치게 한다.
  • 변동 길이 롤아웃을 활용하여 온정책 데이터를 유지함으로써 동기화 블로킹 없이 높은 샘플 효율성을 확보한다.
  • Habitat와 같은 기존 시뮬레이터와 통합되며, 최소한의 아키텍처 변경으로 다중 환경 배치를 지원한다.
  • 학습과 경험 수집을 겹치게 하여 컴퓨팅 자원 활용도와 처리량을 향상시킨다.

실험 결과

연구 질문

  • RQ1이질적이고 다중 GPU 환경에서 샘플 효율성을 희생시키지 않고 온정책 RL을 효율적으로 확장할 수 있는가?
  • RQ2환경별로 롤아웃 길이를 동적으로 조정하면 온정책 학습에서 스트래글러 효과가 제거되는가?
  • RQ3비탐색 태스크에 탐색 행동을 활성화하면 잠재적 탐색 정책이 나타나는가?
  • RQ4DD-PPO와 SampleFactory와 같은 최첨단 온정책 방법들과 비교해 VER의 속도와 샘플 효율성은 어떠한가?
  • RQ5잠재적 탐색이 HAB와 같은 복잡한 몸체 재배치 벤치마크에서 성능 향상에 기여하는가?

주요 결과

  • Habitat 1.0의 PointGoal 및 ObjectGoal 탐색 작업에서 VER는 DD-PPO보다 60~100% 더 빠른 학습 속도(1.6~2배 속도 향상)를 달성했으며, 유사한 샘플 효율성을 유지했다.
  • Habitat 2.0의 모바일 맨리퓰레이션 작업에서 VER는 1GPU 기준 150% 빠르게(2.5배 속도 향상), 8GPU 기준 170% 빠르게(2.7배 속도 향상) DD-PPO를 초월했다.
  • 8GPU 환경에서 VER는 SampleFactory보다 70% 더 빠르게(1.7배 속도 향상) 작동했으며, 더 높은 샘플 효율성을 확보했고, 기존 SampleFactory 대비 스킬당 11.2 GPU일을 절약했다.
  • VER는 DD-PPO 대비 PointNav에서 19.2 GPU일, ObjectNav에서 28 GPU일을 절약했다.
  • Home Assistant Benchmark(HAB)에서 VER로 학습된 에이전트는 Tidy House에서 성공률이 30% 향상되어 분포 외 일반화 능력 향상을 입증했다.
  • 놀랍게도, 탐색이 필요하지 않은 Pick 스킬이 기본 이동 기능이 활성화된 환경에서 50% 성공률로 탐색을 유도하는 것을 관찰했으며, 이는 잠재적 탐색 행동의 유도를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.