Skip to main content
QUICK REVIEW

[논문 리뷰] Mirror Learning: A Unifying Framework of Policy Optimisation

Jakub Grudzien Kuba, Christian Schroeder de Witt|arXiv (Cornell University)|2022. 01. 07.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 강화학습에서 정책 최적화를 위한 통합 이론적 프레임워크인 미러 학습(Mirror Learning)을 소개한다. 이는 단조 증가성과 수렴 보장을 제공하며, 최신 알고리즘인 PPO와 TRPO가 자연스럽게 이 프레임워크에 통합됨을 보여주어, 히وري스틱한 유사성에 의존하는 것이 아니라 엄밀한 이론에 기반해 그 경험적 성공을 설명한다.

ABSTRACT

Modern deep reinforcement learning (RL) algorithms are motivated by either the generalised policy iteration (GPI) or trust-region learning (TRL) frameworks. However, algorithms that strictly respect these theoretical frameworks have proven unscalable. Surprisingly, the only known scalable algorithms violate the GPI/TRL assumptions, e.g. due to required regularisation or other heuristics. The current explanation of their empirical success is essentially "by analogy": they are deemed approximate adaptations of theoretically sound methods. Unfortunately, studies have shown that in practice these algorithms differ greatly from their conceptual ancestors. In contrast, in this paper we introduce a novel theoretical framework, named Mirror Learning, which provides theoretical guarantees to a large class of algorithms, including TRPO and PPO. While the latter two exploit the flexibility of our framework, GPI and TRL fit in merely as pathologically restrictive corner cases thereof. This suggests that the empirical performance of state-of-the-art methods is a direct consequence of their theoretical properties, rather than of aforementioned approximate analogies. Mirror learning sets us free to boldly explore novel, theoretically sound RL algorithms, a thus far uncharted wonderland.

연구 동기 및 목표

  • 이론적 강화학습 프레임워크(GPI 및 TRL)와 PPO 및 TRPO와 같은 확장성 있고 실용적인 알고리즘 간의 격차를 해소하기 위해.
  • GPI 및 TRL의 핵심 가정을 위반하는 널리 사용되는 알고리즘들에 대한 이론적 정당성이 부족한 문제를 해결하기 위해.
  • 기존 방법들을 포괄하면서도 새로운 이론적으로 타당한 알고리즘 설계를 가능하게 하는 원칙적인 일반 프레임워크를 제공하기 위해.
  • PPO 및 유사한 방법들의 경험적 성공을 근거 없는 유사성에 기반해 설명하는 것이 아니라, 새로운 프레임워크 내부의 내재된 이론적 성질을 통해 설명하기 위해.

제안 방법

  • 정책 업데이트 비용(이하 '드리프트')을 제약하고 현재 정책의 이웃 영역으로의 업데이트를 제한하면서 가치 함수를 최대화하는 일반 정책 최적화 프레임워크인 미러 학습을 도입한다.
  • 임의의 드리프트 함수성(예: KL 발산, L2 거리, 총변동 거리)을 사용하여 정책 업데이트 비용을 측정함으로써, 융통성 있고 확장 가능한 제약 조건을 가능하게 한다.
  • 제약 최적화를 통한 정책 업데이트 정의: 드리프트 및 이웃 제약 조건을 만족시키는 조건 하에 가치 함수 향상을 최대화한다.
  • 이론적 보장을 수립: 임의의 업데이트 크기 제약 조건 하에서도 단조 증가성과 최적 정책 수렴 보장.
  • 정책 최적화를 방향 그래프 상의 탐색으로 재해석하며, 경로 가중치는 상태 간 최적성 갭에 의해 상한이 둔다.
  • 단순한 환경(단일 스텝 게임, 표본 게임, 그리드월드)을 사용하여 수치적 검증을 수행하며, 다양한 드리프트 및 이웃 구성 조건을 적용한다.

실험 결과

연구 질문

  • RQ1GPI 및 TRL의 가정을 위반함에도 불구하고 PPO 및 TRPO와 같은 확장 가능한 딥 강화학습 알고리즘이 강력한 경험적 성능을 내는 이유는 무엇인가?
  • RQ2이러한 알고리즘의 성공을 설명하고 공식적인 수렴 보장을 제공하는 통합 이론적 프레임워크를 개발할 수 있는가?
  • RQ3GPI 및 TRL의 엄격한 제약 조건을 초월하여 더 넓은 범위의 안정적이고 확장 가능한 알고리즘을 포함할 수 있는 정책 최적화의 일반화 방법은 무엇인가?
  • RQ4드리프트 함수성의 선택과 정책 최적화 알고리즘의 수렴 행동 간의 관계는 무엇인가?
  • RQ5정책 최적화를 경로 가중치가 유계인 그래프 탐색 문제로 형식화할 수 있으며, 이러한 시각적 관점은 새로운 이론적 통찰을 제공하는가?

주요 결과

  • 미러 학습은 PPO 및 TRPO를 포함한 광범위한 알고리즘 클래스에 대해 단조 증가성과 최적 정책 수렴 보장을 제공하는 이론적 보장을 제공한다.
  • PPO 및 TRPO는 미러 학습의 자연스러운 사례로 나타나며, 경험적 성공이 히وري스틱한 유사성에 기반한 것이 아니라 내재된 이론적 성질에 기반함을 입증한다.
  • 수치 실험 결과, 미러 학습 프레임워크 내의 알고리즘이 단조 증가성을 보이며 단순한 환경에서 최적 수익으로 수렴하는 것으로 확인된다.
  • 총 드리프트(정책 업데이트 크기의 척도)가 수익 증가량에 대해 유계로 유지되며, 논문의 이론적 부등식 (9)가 실험적으로 확인된다.
  • 다양한 드리프트 함수성(KL, L2, TV, 0)은 이웃 연산자의 선택보다 학습 곡선에 더 큰 영향을 미치며, 둘 다 수렴 동역학에 영향을 준다.
  • 미러 학습의 그래프 이론적 해석은 최적화 경로에서 임의의 두 정책 간의 총 경로 가중치가 최적성 갭에 의해 상한이 있음을 보여주며, 이는 실험적으로 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.