Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Pessimism for Robust and Efficient Off-Policy Reinforcement Learning

Edoardo Cetin, Oya Çeliktutan|arXiv (Cornell University)|2021. 10. 07.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 일반화된 비관 학습(GPL)을 소개한다. 이는 이중 TD-학습을 통해 오프-폴리시 딥 강화학습에서 과소평가는 편향을 수정하기 위해 동적 페널티를 학습하는 새로운 방법이다. GPL을 SAC 및 DrQ와 통합함으로써, 최소한의 계산 부담으로 사전적 및 픽셀 기반 벤치마크에서 최신 기술 수준의 성능을 달성하며, 샘플 효율성과 학습 속도 면에서 이전 방법들을 능가한다.

ABSTRACT

Off-policy deep reinforcement learning algorithms commonly compensate for overestimation bias during temporal-difference learning by utilizing pessimistic estimates of the expected target returns. In this work, we propose Generalized Pessimism Learning (GPL), a strategy employing a novel learnable penalty to enact such pessimism. In particular, we propose to learn this penalty alongside the critic with dual TD-learning, a new procedure to estimate and minimize the magnitude of the target returns bias with trivial computational cost. GPL enables us to accurately counteract overestimation bias throughout training without incurring the downsides of overly pessimistic targets. By integrating GPL with popular off-policy algorithms, we achieve state-of-the-art results in both competitive proprioceptive and pixel-based benchmarks.

연구 동기 및 목표

  • 오프-폴리시 딥 강화학습에서 정책 학습의 안정성과 샘플 효율성을 해치는 과소평가는 편향을 해결하기 위해.
  • 고정되거나 히우리스틱 전략에 의존하지 않는, 학습 가능한 적응형 비관 메커니즘을 개발하기 위해.
  • 초기 학습 단계에서 지식 불확실성을 활용해 방향성 있는 탐색을 이끄는 비관 안내법을 도입하여 탐색을 향상시키기 위해.
  • SAC 및 DrQ와 같은 기존의 오프-폴리시 알고리즘과 제안된 방법을 통합하여 강력하고 확장 가능한 성능 향상을 이루기 위해.
  • 다양한 벤치마크 환경에서 최신 기술 수준의 결과를 낮은 계산 부담으로 달성할 수 있음을 입증하기 위해.

제안 방법

  • 시간 차분 학습 중 크리틱 타겟의 과소평가는 편향을 수정하기 위한 학습 가능한 페널티 메커니즘인 일반화된 비관 학습(GPL)을 제안한다.
  • 이중 기울기 하강을 사용하여 크리틱 예측의 편향을 추정하고 최소화하는 새로운 최적화 절차인 이중 TD-학습을 도입한다.
  • 지식 불확실성으로 측정된 예상 워샤르 거리에 기반해 페널티 가중치를 계산한다. 이는 다수의 크리틱 네트워크가 예측한 리워드 분포 간의 거리를 기반으로 한다.
  • 초기 학습 단계에서 고도의 불확실성 상태에서 탐색을 장려하기 위해 편향이 있는 위험 수용 타겟으로 시작하는 비관 안내법을 적용한다.
  • 제안된 방법을 소프트 액터-크리틱(SAC) 및 데이터 정규화 Q(DoQ) 알고리즘과 통합하여 각각 GPL-SAC 및 GPL-DrQ를 구성한다.
  • 현대 하드웨어에서의 계산 효율성과 확장성을 향상시키기 위해 다수의 크리틱 네트워크 간에 공유되고 그룹화된 파라미터화를 사용한다.

실험 결과

연구 질문

  • RQ1고정되거나 히우리스틱 전략에 의존하지 않고도, 학습 가능한 동적 페널티 메커니즘이 오프-폴리시 딥 강화학습에서 과소평가는 편향을 효과적으로 수정할 수 있는가?
  • RQ2표준 TD-학습과 비교했을 때, 이중 TD-학습은 크리틱 예측의 편향을 추정하고 최소화하는 데 어떻게 다른가?
  • RQ3비관 안내법은 초기 학습 단계에서 탐색과 샘플 효율성을 어느 정도 향상시키는가?
  • RQ4GPL은 최소한의 계산 부담으로 사전적 및 픽셀 기반 환경 모두에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5크리틱 아키텍처의 선택(예: 표준 대비 분포 기반)은 GPL의 성능과 효율성에 어떤 영향을 미치는가?

주요 결과

  • GPL-SAC는 100,000번 이하의 환경 스텝 내에 하이퍼모이드 환경에서 5000점의 점수를 기록했으며, 표준 SAC보다 9배 이상 빠르게 달성했다.
  • GPL-SAC는 어려운 MuJoCo 벤치마크에서 모델 기반 및 모델리스 최신 기술 수준의 알고리즘을 모두 능가했으며, 저자원 환경에서도 성능이 뛰어났다.
  • GPL-DrQ는 딥마인드 컨트롤 스위트의 픽셀 기반 환경에서 최근의 DrQv2 베이스라인보다 성능 향상을 보였다.
  • GPL의 계산 부담은 극히 미미하다. 이중 TD-학습과 비관 안내법을 추가했을 때, 기준 SAC 대비 학습 시간이 오직 2.5% 증가할 뿐이었다.
  • 크리틱 네트워크의 수를 2개에서 20개로 늘였을 때 학습 시간이 12% 미만으로 증가하여, 비선형적 확장성과 뛰어난 하드웨어 효율성을 보였다.
  • W_1 기반의 불확실성 추정을 사용하는 GPL-QR-SAC는 GPL-SAC와 유사한 성능을 보였으며, 이는 오픈AI 견적과 같은 저확률 환경에서는 분포 기반 크리틱이 큰 성능 향상을 가져오지 못한다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.