Skip to main content
QUICK REVIEW

[논문 리뷰] Discovered Policy Optimisation

Chris Xiaoxuan Lu, Jakub Grudzien Kuba|arXiv (Cornell University)|2022. 10. 11.
Machine Learning and Data Classification인용 수 16
한 줄 요약

이 논문은 미러 학습 프레임워크 내에서 메타학습을 통해 발견된 새로운 딥 강화학습 알고리즘인 발견 정책 최적화(DPO)를 소개한다. 진화 전략을 사용해 신경망 드리프트 함수를 메타최적화함으로써 저자들은 먼저 학습된 정책 최적화(LPO)를 학습하고, 그 핵심 행동 통찰—신중한 낙관주의와 롤백—을 담은 폐쇄형, 이론적으로 타당한 알고리즘인 DPO로 정밀하게 변환한다. 이 DPO는 하이퍼파라미터 조정 없이도 LPO의 성능을 그대로 유지하며, Brax 환경에서 PPO를 능가한다.

ABSTRACT

Tremendous progress has been made in reinforcement learning (RL) over the past decade. Most of these advancements came through the continual development of new algorithms, which were designed using a combination of mathematical derivations, intuitions, and experimentation. Such an approach of creating algorithms manually is limited by human understanding and ingenuity. In contrast, meta-learning provides a toolkit for automatic machine learning method optimisation, potentially addressing this flaw. However, black-box approaches which attempt to discover RL algorithms with minimal prior structure have thus far not outperformed existing hand-crafted algorithms. Mirror Learning, which includes RL algorithms, such as PPO, offers a potential middle-ground starting point: while every method in this framework comes with theoretical guarantees, components that differentiate them are subject to design. In this paper we explore the Mirror Learning space by meta-learning a "drift" function. We refer to the immediate result as Learnt Policy Optimisation (LPO). By analysing LPO we gain original insights into policy optimisation which we use to formulate a novel, closed-form RL algorithm, Discovered Policy Optimisation (DPO). Our experiments in Brax environments confirm state-of-the-art performance of LPO and DPO, as well as their transfer to unseen settings.

연구 동기 및 목표

  • 수작업으로 설계된 RL 알고리즘의 한계, 즉 하이퍼파라미터 민감도와 낮은 안정성 문제를 해결하기 위해 알고리즘 자동 발견을 자동화한다.
  • 이론적으로 탄탄한 프레임워크인 미러 학습 내에서 알고리즘 발견을 탐색하여 수렴성과 안정성을 보장한다.
  • 드리프트 함수의 메타학습을 통해 높은 성능을 내고 일반화 가능한 RL 알고리즘을 발견함으로써 인간의 직관에 의존하지 않는다.
  • 학습된 신경망 기반 드리프트 함수로부터의 통찰을 단순한 폐쇄형 알고리즘으로 정밀하게 변환하여 실용적 구현에 적합하게 한다.

제안 방법

  • 진화 전략(ES)을 사용해 미러 학습 프레임워크 내에서 드리프트 함수의 신경망 파arameterization을 메타학습한다.
  • 여러 시드를 기반으로 한 Brax 환경의 일부(특히 Ant)에서 드리프트 함수를 학습하여 정책 성능을 최적화한다.
  • 학습된 LPO 드리프트 함수를 분석하여 고상한 낙관주의와 저성과 행동에 대한 롤백과 같은 핵심 알고리즘 행동 패턴을 식별한다.
  • ReLU와 tanh 활성화 함수를 사용해 LPO의 핵심 행동을 재현하는 폐쇄형, 하이퍼파라미터 없는 드리프트 함수인 발견 정책 최적화(DPO)를 유도한다.
  • 이점의 부호와 행동 보상 이력에 의존하는 두 줄의 분석적 업데이트 규칙으로 DPO를 구현한다.
  • LPO와 DPO를 훈련 분포 외부의 Brax 환경과 Minatar 환경에서 평가하여 제로샷 일반화성과 안정성을 테스트한다.

실험 결과

연구 질문

  • RQ1이론적으로 탄탄한 프레임워크인 미러 학습에서 메타학습을 통해 수작업으로 설계된 기준보다 뛰어난 성능을 내는 RL 알고리즘을 발견할 수 있는가?
  • RQ2학습된 드리프트 함수에서 어떤 행동 패턴이 정책 최적화 성능 향상에 기여하는가?
  • RQ3학습된 신경망 기반 드리프트 함수로부터의 통찰을 성능 손실 없이 단순한 폐쇄형 알고리즘으로 정밀하게 변환할 수 있는가?
  • RQ4발견된 알고리즘이 하이퍼파라미터 조정 없이도 훈련 분포 외부 환경으로 일반화되는가?
  • RQ5메타학습된 알고리즘이 이론적 수렴 보장을 유지하면서도 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 학습된 정책 최적화(LPO)는 하이퍼파라미터 조정 없이도 Brax 환경 전반에서 최신 기술 수준의 성능을 달성하며, PPO를 모두의 평가 과제에서 능가한다.
  • 발견 정책 최적화(DPO)는 Brax 환경 전반에서 LPO의 성능을 그대로 유지하며, 두 줄의 폐쇄형 분석적 업데이트 규칙임에도 불구하고 PPO를 능가한다.
  • DPO는 Minatar 환경으로 일반화되어, PPO의 튜닝된 하이퍼파라미터로 평가했을 때도 강력한 성능을 유지하며, 뛰어난 제로샷 전이 능력을 보여준다.
  • LPO 분석 결과, 두 가지 핵심 행동 특징—고이점 행동에 대한 신중한 낙관주의와 저성과 행동에 대한 롤백—이 그 성공의 핵심 요소임을 밝혀냈다.
  • DPO 드리프트 함수는 이 두 가지 특징을 ReLU와 tanh 구성 요소를 사용해 명시적으로 재현하도록 설계되었으며, 상수 α=2와 β=0.6를 사용하고, 미러 학습 수렴 조건을 만족한다.
  • LPO와 DPO는 PPO보다 더 높은 시드 간 일관성을 보이며, 훈련 변동성에 대한 더 높은 안정성을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.