Skip to main content
QUICK REVIEW

[논문 리뷰] Extreme Q-Learning: MaxEnt RL without Entropy

Divyansh Garg, Joey Hejna|arXiv (Cornell University)|2023. 01. 05.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 극값 이론(EVT)과 구름벨 분포를 활용하여 최대 엔트로피 강화학습(MaxEnt RL)에서 직접 최적의 소프트-가치 함수를 추정하는 새로운 딥 강화학습 프레임워크인 극단 Q-학습(XQL)을 소개한다. 이는 명시적인 정책 네트워크나 엔트로피 계산을 필요로 하지 않으며, 안정적이고 높은 성능을 보이는 온라인 및 오프라인 MaxEnt Q-학습을 가능하게 한다. 구름벨 회귀를 통해 로그-파트리션 함수(LogSumExp)를 모델링함으로써 XQL은 정책 외삽 오류를 피하면서도, D4RL의 프랭카 키친 작업에서 10점 이상의 성능 향상을 기록하여 최신 기술 수준(SOTA)을 달성한다.

ABSTRACT

Modern Deep Reinforcement Learning (RL) algorithms require estimates of the maximal Q-value, which are difficult to compute in continuous domains with an infinite number of possible actions. In this work, we introduce a new update rule for online and offline RL which directly models the maximal value using Extreme Value Theory (EVT), drawing inspiration from economics. By doing so, we avoid computing Q-values using out-of-distribution actions which is often a substantial source of error. Our key insight is to introduce an objective that directly estimates the optimal soft-value functions (LogSumExp) in the maximum entropy RL setting without needing to sample from a policy. Using EVT, we derive our \emph{Extreme Q-Learning} framework and consequently online and, for the first time, offline MaxEnt Q-learning algorithms, that do not explicitly require access to a policy or its entropy. Our method obtains consistently strong performance in the D4RL benchmark, outperforming prior works by \emph{10+ points} on the challenging Franka Kitchen tasks while offering moderate improvements over SAC and TD3 on online DM Control tasks. Visualizations and code can be found on our website at https://div99.github.io/XQL/.

연구 동기 및 목표

  • 연속된 행동 공간에서 최적의 소프트-가치 함수(LogSumExp)를 추정하는 데 있어, 기존 MaxEnt RL 방법이 비가역적인 엔트로피 계산과 정책 샘플링에 의존하는 문제를 해결하기 위해.
  • 온라인 및 오프라인 RL 전반에서 오류와 불안정성을 유발하는 보조 정책 네트워크와 명시적 엔트로피 추정의 필요성을 제거하기 위해.
  • 진정한 벨만 백업 연산자 $\mathcal{B}^*$를 직접 최적화하는 이론적으로 타당하고 엔드 투 엔드로 미분 가능한 온라인 및 오프라인 MaxEnt Q-학습 프레임워크를 개발하기 위해.
  • 제안된 EVT 기반 공식화 하에서, 보수적인 Q-학습과 소프트 Q-학습 간의 격차를 메우기 위해.
  • 액터-크리틱 방법에서 악영향을 미치는 분포 외 행동 샘플링을 피함으로써 오프라인 RL의 샘플 효율성과 내구성을 향상시키기 위해.

제안 방법

  • Q-가치 추정 오차의 분포를 구름벨 분포로 모델링하며, 맥팔든의 이산 선택 이론과 극값 이론(EVT)에 영감을 받아, 구름벨이 최대값의 점근적 분포로써 타당함을 정당화한다.
  • 로그-파트리션 함수(LogSumExp)에 대한 일致한 추정기로 구름벨 회귀를 도입함으로써, 연속된 행동 공간에서 최적의 소프트-가치 함수 $V^*$의 미분 가능한 추정이 가능해진다.
  • 진정한 MaxEnt 벨만 연산자 $\mathcal{B}^*$를 직접 최적화하는 새로운 벨만 손실 목표를 유도하며, 정책 네트워크나 행동에 대한 소프트맥스를 필요로 하지 않는다.
  • SGD를 사용한 구름벨 손실에 기반한 온라인 및 오프라인 XQL 알고리즘을 제안하며, 명시적인 정책 네트워크나 엔트로피 정규화가 없다.
  • 온라인 및 특히 도전적인 오프라인 설정에서 학습을 안정화시키기 위해 환경별로 온도 $\beta$, 기울기 클리핑, 가치 업데이트 빈도 등의 하이퍼파라미터를 조정한다.
  • D4RL 벤치마크(마우지코, 앤티메이즈, 프랭카 키친 포함)에서 검증되었으며, 아블레이션 스터디를 통해 구름벨 기반 추정이 표준 방법보다 유의미한 이점을 제공함을 확인하였다.

실험 결과

연구 질문

  • RQ1정책에서 샘플링 없이도 연속된 행동 공간에서 로그-파트리션 함수(LogSumExp)에 대한 일관되고 미분 가능한 추정기로 극값 이론을 활용할 수 있는가?
  • RQ2Q-가치 오차를 구름벨 분포로 모델링하면, MaxEnt RL에서 최적의 소프트-가치 함수 추정이 더 안정적이고 정확해지는가?
  • RQ3정책 네트워크나 엔트로피 정규화에 의존하지 않고도 XQL이 외삽 오류를 피하면서 오프라인 RL에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4제안된 구름벨 기반 벨만 손실은 표준 소프트-Q 학습 및 보수적인 Q-학습에 비해 샘플 효율성과 최종 수익 측면에서 어떻게 비교되는가?
  • RQ5XQL 프레임워크는 어느 정도의 범위에서 소프트 Q-학습과 보수적인 Q-학습을 동일한 이론적 기반 아래 통합하는가?

주요 결과

  • XQL은 도전적인 D4RL 프랭카 키친 작업에서 기존 방법 대비 10점 이상의 성능 향상을 기록하며, 기존 오프라인 RL 기반 모델을 크게 능가한다.
  • D4RL 오프라인 마우지코 벤치마크에서 XQL-Tuned(Hyperparameter-tuned 버전)은 SAC와 TD3를 일관되게 따라하거나 초월하며, 가장 어려운 환경에서 두드러진 성과를 기록한다.
  • 액터-크리틱 알고리즘에서 주요 오류 원인이 되는 분포 외 행동 샘플링을 피함으로써, 오프라인 RL에서 학습 안정성이 향상됨을 입증하였다.
  • 온라인 RL 환경에서도 XQL은 SAC와 TD3와 유사한 성능을 보이며, 중간 정도의 향상을 기록하였고, 별도의 정책 네트워크와 엔트로피 계산이 필요로 하지 않음을 확인하였다.
  • 아블레이션 스터디를 통해, Q-가치 오차가 정규분포가 아닐 경우에 특히 더 정확한 구름벨 기반의 로그-파트리션 함수 추정이 표준 방법보다 뛰어나다는 점을 확인하였다.
  • 프레임워크는 소프트 Q-학습과 보수적인 Q-학습을 성공적으로 통합하였으며, 제안된 EVT 기반 공식화 하에서 MaxEnt RL이 자연스럽게 보수성의 한 형태로 나타남을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.