Skip to main content
QUICK REVIEW

[논문 리뷰] Muesli: Combining Improvements in Policy Optimization

Matteo Hessel, Ivo Danihelka|arXiv (Cornell University)|2021. 04. 13.
Reinforcement Learning in Robotics참고 문헌 88인용 수 12
한 줄 요약

Muesli는 정규화된 정책 최적화와 모델 기반의 1단계 앞서보기 가치 추정을 결합한 새로운 정책 최적화 방법을 제안하며, 깊은 탐색 없이도 아타리 게임에서 최신 기술 수준의 성능을 달성한다. 깊은 탐색 없이도 정책 네트워크 하나와 1단계 계획만으로 MuZero의 성능을 재현하면서도, 모델 자유 방법과 유사한 계산 속도를 유지한다.

ABSTRACT

We propose a novel policy update that combines regularized policy optimization with model learning as an auxiliary loss. The update (henceforth Muesli) matches MuZero's state-of-the-art performance on Atari. Notably, Muesli does so without using deep search: it acts directly with a policy network and has computation speed comparable to model-free baselines. The Atari results are complemented by extensive ablations, and by additional results on continuous control and 9x9 Go.

연구 동기 및 목표

  • 깊은 탐색이나 계획에 의존하지 않고 아타리 게임에서 최신 기술 수준의 성능을 달성하는 정책 최적화 방법을 개발한다.
  • 모델 기반 가치 추정을 정규화된 정책 최적화에 통합하여 샘플 효율성과 강건성을 향상시킨다.
  • 트리 탐색의 지연을 피하기 위해 정책 네트워크를 직접 사용함으로써 높은 계산 효율성을 유지한다.
  • 연속 제어 및 9x9 고와 같은 다양한 환경에서의 일반화 성능을 평가한다.
  • 방법의 핵심 구성 요소를 분석하여 성능에 기여하는 요소를 이해한다.

제안 방법

  • Muesli는 MuZero를 모델로 활용하여 1단계 앞서보기 가치를 추정함으로써 부트스트랩 가치 타겟을 제공한다.
  • 최대 사후 확률 정책 최적화(MPO) 프레임워크 내에서 클리핑된 정규화된 이점 메커니즘을 사용하여 학습을 안정화하고 척도 문제를 방지한다.
  • 클리핑된 MPO 타겟과 정책 기울기 값을 직접 통합하여 엔드 투 엔드 최적화 방식으로 정책 업데이트를 수행한다.
  • 정책 기울기 추정의 분산을 줄이기 위해 동작에 의존하는 기준점(β-LOO)을 도입한다.
  • 정책과 가치 함수 추정을 위한 공유된 신경망을 사용하여 효율적인 파라미터 공유를 구현한다.
  • 모델 자유 설정에서 작동하지만, 정책 학습 향상을 위해 학습된 모델을 보조 손실로 활용한다.

실험 결과

연구 질문

  • RQ1정규화된 정책 최적화와 모델 기반 가치 추정을 융합하면 깊은 탐색 없이도 아타리에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ21단계 모델 기반 가치 추정은 샘플 효율성과 학습 안정성에 어떻게 기여하는가?
  • RQ3클리핑된 정규화된 이점과 동작에 의존하는 기준점은 정책 최적화 성능에 어떤 기여를 하는가?
  • RQ4Muesli는 연속 제어 및 소형 체스판 고 환경으로 일반화되는가?
  • RQ5아타리에서 성능에 가장 중요한 요소는 무엇인가?

주요 결과

  • Muesli는 깊은 탐색 없이도 57개의 아타리 게임에서 MuZero의 중앙값 인간 정규화 점수를 재현하며, 표준 75% 재생 설정에서 139,409 ± 12,178의 점수를 기록한다.
  • 대규모 MuZero 설정(95% 재생, 더 큰 네트워크)에서 Muesli는 1,363,427 ± 81,093의 점수를 기록하여, 보고된 MuZero의 점수 1,355,410 ± 65,349를 초월한다.
  • 아블레이션 연구 결과, β-LOO 기준점 사용이 성능 향상에 크게 기여하는 것으로 나타났으며, 온도를 가진 소프트맥스나 직접 CMPO 없이 정책를 작동시키는 경우 성능이 열 劣화된다.
  • 연속 제어 환경으로의 일반화 성능이 뛰어나며, MuJoCo 벤치마크에서 뛰어난 성능을 보였다.
  • 9x9 고에서 Muesli는 강력한 자가 대결 성능을 기록하여, 기존에 몬테카를로 트리 탐색에 의존하는 분야에서도 효과적임을 입증했다.
  • 스택된 프레임의 아블레이션 분석 결과, Muesli는 다양한 관측 역사에서도 성능를 유지하며 입력 표현에 대한 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.