Skip to main content
QUICK REVIEW

[논문 리뷰] Is the Policy Gradient a Gradient?

Chris Nota, Philip S. Thomas|arXiv (Cornell University)|2019. 06. 17.
Reinforcement Learning in Robotics참고 문헌 29인용 수 6
한 줄 요약

이 논문은 대부분의 정책 그래디언트 방법, 특히 최신 알고리즘인 PPO, SAC, TD3를 포함하여 할인 요소를 잘못 다루기 때문에 어떤 목적 함수의 그래디언트를 따르지 않는다는 것을 증명한다. 저자들은 이러한 방법들이 진정한 그래디언트가 아닌 방향을 최적화함으로써 수렴하지 않거나 최악의 고정점을 유도하며, 높은 인용 수를 기록한 논문들 사이에도 널리 퍼진 이론적 오류를 드러낸다.

ABSTRACT

The policy gradient theorem describes the gradient of the expected discounted return with respect to an agent's policy parameters. However, most policy gradient methods drop the discount factor from the state distribution and therefore do not optimize the discounted objective. What do they optimize instead? This has been an open question for several years, and this lack of theoretical clarity has lead to an abundance of misstatements in the literature. We answer this question by proving that the update direction approximated by most methods is not the gradient of any function. Further, we argue that algorithms that follow this direction are not guaranteed to converge to a "reasonable" fixed point by constructing a counterexample wherein the fixed point is globally pessimal with respect to both the discounted and undiscounted objectives. We motivate this work by surveying the literature and showing that there remains a widespread misunderstanding regarding discounted policy gradient methods, with errors present even in highly-cited papers published at top conferences.

연구 동기 및 목표

  • 현대 정책 그래디언트 방법이 유효한 목적 함수를 최적화하는지 여부에 대한 오랫동안 미해결된 열린 질문을 해결하기 위해.
  • 상위 컨fer런스에서 발표된 고도로 인용된 논문들 사이에도 널리 퍼진 이론적 오류를 드러내기 위해.
  • 대부분의 정책 그래디언트 알고리즘에서 사용하는 업데이트 방향이 어떤 함수의 그래디언트가 아니라는 것을 보여주기 위해.
  • 이 알고리즘의 고정점이 할인된 및 할인되지 않은 목적 모두에서 전역적으로 최악일 수 있음을 보여주기 위해.
  • 정책 그래디언트 방법의 이론적 기초를 명확히 하고 강화학습 커뮤니티 내의 오해를 바로잡기 위해.

제안 방법

  • 할인 요소를 잘못 다루었기 때문에 대부분의 정책 그래디언트 방법에서 업데이트 방향이 어떤 목적 함수의 그래디언트가 되지 않는다는 것을 수학적으로 증명한다.
  • 정책 그래디언트 정리 분석을 통해 상태 분포에서 할인 요소의 한 개의 인스턴스를 생략한 오류를 특정한다.
  • 할인된 및 할인되지 않은 수익 모두에서 고정점이 전역적으로 최악이 되는 반례를 구성한다.
  • stable-baselines 라이브러리에서 유래한 8개의 상위 수준 강화학습 알고리즘(PPO, SAC, TD3, A2C/A3C 등)을 검토하고, 이들이 잘못된 그래디언트 공식을 사용하고 있음을 확인한다.
  • 이론적 분석과 실험적 검토를 통해 8篇의 논문 중 유일하게 진정한 정책 그래디언트에서의 이탈을 인정한 것은 1篇 뿐이며, 나머지는 편향 없는 추정에 대한 잘못된 또는 오해의 소재가 되는 주장들을 내놓는다.
  • 문헌에서 잘못된 주장이 발생한 이유는 표현의 모호성 때문이며, 예를 들어 참조 목적 함수를 명시하지 않은 채 '편향 없는 추정기'라고 주장하는 식이다.

실험 결과

연구 질문

  • RQ1현대 정책 그래디언트 방법에서 사용하는 업데이트 방향이 어떤 목적 함수의 그래디언트인가?
  • RQ2PPO 및 SAC와 같은 최첨단 정책 그래디언트 알고리즘이 실제로 최적화하는 목적 함수는 무엇인가?
  • RQ3이 알고리즘의 고정점이 할인된 및 할인되지 않은 수익 모두에 대해 전역적으로 최악일 수 있는가?
  • RQ4왜 널리 인용된 강화학습 논문들이 그들의 그래디언트 추정기의 편향 없는 성질에 관해 잘못된 주장을 계속하고 있는가?
  • RQ5상태 분포에서 할인 요소를 잘못 다루는 것이 정책 그래디언트 방법의 수렴성과 최적성에 어떤 영향을 미치는가?

주요 결과

  • PPO, SAC, TD3, A2C/A3C를 포함한 대부분의 정책 그래디언트 방법은 상태 분포를 잘못 설정함으로써 어떤 목적 함수의 그래디언트를 따르지 않는다.
  • 이 알고리즘에서 사용하는 업데이트 방향은 어떤 함수의 그래디언트가 아니며, 이는 최적 정책로의 수렴 주장에 대한 정당성을 무너뜨린다.
  • 할인된 및 할인되지 않은 수익 목적 모두에서 고정점이 전역적으로 최악이 되는 반례를 구성하였다.
  • 검토한 8편의 고도로 인용된 강화학습 논문 중 유일하게 진정한 정책 그래디언트에서의 이탈을 인정한 것은 1편 뿐이며, 나머지는 편향 없는 추정에 대한 오해의 소재가 되는 잘못된 주장들을 내놓았다.
  • 오해의 근본 원인은 문헌에서 표현의 모호성에 기인한다. 예를 들어 참조 목적 함수를 명시하지 않은 채 '편향 없는 추정기'라고 주장하는 식이다. 이로 인해 널리 퍼진 오해가 발생했다.
  • 분석을 통해 많은 최첨단 딥 강화학습 알고리즘의 설계에 근본적인 이론적 결함이 드러났으며, 이는 그들의 이론적 정당성에 심각한 영향을 미친다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.