Skip to main content
QUICK REVIEW

[논문 리뷰] A Workflow for Offline Model-Free Robotic Reinforcement Learning

Aviral Kumar, Anikait Singh|arXiv (Cornell University)|2021. 09. 22.
Reinforcement Learning in Robotics참고 문헌 53인용 수 6
한 줄 요약

이 논문은 실세계 로봇 조작 작업에서 기존 방법이 실패한 70%의 성공률을 달성하는 실용적이고 모델에 종속되지 않는 오프라인 모델 프리 로봇 강화학습 워크플로우를 제안한다. 온라인 롤아웃 없이도 효과적인 초모수 및 아키텍처 튜닝을 가능하게 하며, 데이터셋 Q-값과 CQL 정규화 기준치를 통해 과적합과 부족적합을 모니터링함으로써 정책 선택, 정규화 및 아키텍처 선택을 안내한다.

ABSTRACT

Offline reinforcement learning (RL) enables learning control policies by utilizing only prior experience, without any online interaction. This can allow robots to acquire generalizable skills from large and diverse datasets, without any costly or unsafe online data collection. Despite recent algorithmic advances in offline RL, applying these methods to real-world problems has proven challenging. Although offline RL methods can learn from prior data, there is no clear and well-understood process for making various design choices, from model architecture to algorithm hyperparameters, without actually evaluating the learned policies online. In this paper, our aim is to develop a practical workflow for using offline RL analogous to the relatively well-understood workflows for supervised learning problems. To this end, we devise a set of metrics and conditions that can be tracked over the course of offline training, and can inform the practitioner about how the algorithm and model architecture should be adjusted to improve final performance. Our workflow is derived from a conceptual understanding of the behavior of conservative offline RL algorithms and cross-validation in supervised learning. We demonstrate the efficacy of this workflow in producing effective policies without any online tuning, both in several simulated robotic learning scenarios and for three tasks on two distinct real robots, focusing on learning manipulation skills with raw image observations with sparse binary rewards. Explanatory video and additional results can be found at sites.google.com/view/offline-rl-workflow

연구 동기 및 목표

  • 실세계 로봇 제어에서 오프라인 강화학습의 초모수 및 아키텍처 튜닝을 위한 체계적인 오프라인 워크플로우 부족 문제를 해결하기 위해.
  • 비용이 많이 들거나 안전하지 않은 온라인 환경 상호작용 없이도 실무자들이 최적의 정책, 정규화 기법, 모델 아키텍처를 선택할 수 있도록 하기 위해.
  • 감독학습의 학습/검증 손실 추적과 유사한 신뢰할 수 있고 재현 가능한 프로토콜을 제공함으로써, 보수적인 오프라인 강화학습 알고리즘에 특화된 프로토콜을 마련하기 위해.
  • 이미지 관측치와 희소 이진 보상이 있는 시뮬레이션 및 실세계 로봇 조작 작업에서 워크플로우의 효과를 경험적으로 검증하기 위해.

제안 방법

  • 평균 데이터셋 Q-값(과적합 탐지용)과 학습 중인 CQL 정규화 기준치(부족적합 탐지용)를 추적하는 워크플로우를 제안한다.
  • 학습 반복 동안 평균 데이터셋 Q-값의 최고 성능을 기반으로 한 정책 선택 지침을 도입한다.
  • 과적합을 완화하기 위해 용량 감소 정규화(드롭아웃, ℓ₁, ℓ₂)를 적용하며, Q-값과 CQL 정규화 기준치 추세를 기반으로 오프라인에서 초모수를 튜닝한다.
  • ρ(ℓ₁/ℓ₂)와 p(드롭아웃)에 대한 체계적인 초모수 검색을 수행하여 Q-값을 안정화시키면서도 충분히 음수인 CQL 정규화 기준치(≤ -2)를 유지하는 값을 찾는다.
  • CQL 및 BRAC와 같은 보수적인 오프라인 강화학습 알고리즘에 워크플로우를 적용하고, 시뮬레이션 및 실세계 로봇 시스템에서 검증한다.
  • 비정책 평가 기준치를 사용해 워크플로우를 검증하고, Q-값 추세와 추정된 정책 수익 간의 일관성을 입증한다.

실험 결과

연구 질문

  • RQ1온라인 환경 롤아웃 없이 오프라인 강화학습의 초모수 및 모델 아키텍처 튜닝을 실무자들이 신뢰할 수 있게 어떻게 수행할 수 있는가?
  • RQ2비정책 평가에 의존하지 않고도 오프라인 강화학습 학습에서 과적합과 부족적합을 효과적으로 탐지할 수 있는 지표는 무엇인가?
  • RQ3감독학습의 학습/검증 손실 패러다임을 모방한 워크플로우가 오프라인 강화학습에 적합하게 조정되어 실세계 로봇 정책 학습에 적용될 수 있는가?
  • RQ4용량 감소 정규화(예: 드롭아웃, ℓ₂)는 오프라인 로봇 강화학습에서 정책 일반화 및 안정성에 어떤 영향을 미치는가?
  • RQ5이 워크플로우가 이미지 관측치와 희소 보상이 있는 실세계 로봇 조작 작업에서 성능을 얼마나 향상시킬 수 있는가?

주요 결과

  • 제안된 워크플로우는 기존 CQL 방법이 완전히 실패한 두 가지 실세계 로봇 조작 작업(Sawyer 로봇)에서 정책 성공률을 70%까지 향상시켰다.
  • ρ = 0.01인 ℓ₂ 정규화와 p = 0.2인 드롭아웃을 사용할 경우, 정규화되지 않은 CQL에 비해 평균 데이터셋 Q-값이 현저히 안정화되고 과적합이 완화됨을 확인했다.
  • 평균 데이터셋 Q-값 지표는 초기 상태 분포 하에서의 추정된 정책 수익과 매우 밀접하게 일치하여, 정책 선택에 사용할 수 있음을 검증했다.
  • 모든 테스트된 ρ 값에서 ℓ₁ 정규화는 Q-값 안정화와 함께 음수인 CQL 정규화 기준치 유지가 불가능하여 성능 향상에 실패했다.
  • 모델 아키텍처 및 초모수 선택에 대해 온라인 튜닝 없이도 효과적으로 수행할 수 있었으며, 다양한 실세계 및 시뮬레이션 로봇 작업에서의 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.