Skip to main content
QUICK REVIEW

[논문 리뷰] Softmax Policy Gradient Methods Can Take Exponential Time to Converge

Gen Li, Yuting Wei|arXiv (Cornell University)|2021. 02. 22.
Reinforcement Learning in Robotics참고 문헌 51인용 수 7
한 줄 요약

이 논문은 소프트맥스 정책 그래เดียน트 방법이 정확한 그래디언트와 유리한 초기화 조건 하에서도 할인 무한수평 타뷸라 MDP에서 수렴하기 위해 지수적으로 많은 반복을 요구할 수 있음을 보여준다. 저자들은 수렴 시간이 $|1/η| \cdot |\mathcal{S}|^{2^{\Omega(1/(1-\gamma))}}$ 에 비례하는 3개의 행동을 가진 MDP를 구성하여, 널리 사용되는 이 알고리즘의 최악의 경우 반복 복잡도에 대한 근본적인 한계를 드러낸다.

ABSTRACT

The softmax policy gradient (PG) method, which performs gradient ascent under softmax policy parameterization, is arguably one of the de facto implementations of policy optimization in modern reinforcement learning. For $γ$-discounted infinite-horizon tabular Markov decision processes (MDPs), remarkable progress has recently been achieved towards establishing global convergence of softmax PG methods in finding a near-optimal policy. However, prior results fall short of delineating clear dependencies of convergence rates on salient parameters such as the cardinality of the state space $\mathcal{S}$ and the effective horizon $\frac{1}{1-γ}$, both of which could be excessively large. In this paper, we deliver a pessimistic message regarding the iteration complexity of softmax PG methods, despite assuming access to exact gradient computation. Specifically, we demonstrate that the softmax PG method with stepsize $η$ can take \[ \frac{1}η |\mathcal{S}|^{2^{Ω\big(\frac{1}{1-γ}\big)}} ~ ext{iterations} \] to converge, even in the presence of a benign policy initialization and an initial state distribution amenable to exploration (so that the distribution mismatch coefficient is not exceedingly large). This is accomplished by characterizing the algorithmic dynamics over a carefully-constructed MDP containing only three actions. Our exponential lower bound hints at the necessity of carefully adjusting update rules or enforcing proper regularization in accelerating PG methods.

연구 동기 및 목표

  • 소프트맥스 정책 그래디언트 방법의 할인 무한수평 타뷸라 MDP에서 최악의 경우 반복 복잡도를 조사하기 위해.
  • 수렴 속도가 상태공간 크기 $|\mathcal{S}|$ 와 유효 수평 $1/(1-\gamma)$ 에 의해 결정되는지 여부를 규명하기 위해.
  • 최근의 글로벌 수렴 결과가 실용적 효율성을 암시한다는 가정을 도전하기 위해, 잠재적으로 지수적 실행 시간을 드러내기 위해.
  • 정확한 그래디언트 계산 조건 하에서도 알고리즘적 한계를 드러내는 데 어려운 MDP 사례를 구성하기 위해.

제안 방법

  • 저자들은 느린 수렴 동역학을 유도하기 위해 오직 세 개의 행동만을 가진 정교하게 설계된 MDP를 설계하였다.
  • 소프트맥스 매개변수화 하에서 정책 그래디언트 업데이트를 분석하여, 시간에 따라 행동가치 차이와 정책 확률의 변화를 추적하였다.
  • 특히 $\theta(s,a_1) - \theta(s,a_2)$ 의 차이에 초점을 맞추어, 정책 업데이트와 그래디언트 변화 사이의 재귀 관계를 활용하였다.
  • 작은 $x$ 에 대해 $e^x - 1 \leq 2x$ 를 이용한 지수 및 선형 근사에 기반해, 각 단계당 정책 향상의 경계를 유도하였다.
  • 핵심 기법은 정책 확률이 서로 다른 행동에 대해 임계값을 초과할 때의 '교차 시간'을 추적하여, 수렴 속도를 단계별로 제어하는 데 있었다.
  • 증명은 목표 정책에 도달하는 데 소요되는 시간에 대한 재귀 하한을 사용하여, $t_s(\tau_s) - t_{\text{ref}}$ 가 $t_{s-2}(\tau_{s-2})^{1.5}$ 의 함수로 증가함을 보여주며 지수적 붕괴를 이끌어냈다.

실험 결과

연구 질문

  • RQ1정확한 그래디언트가 있음에도 불구하고, 소프트맥스 정책 그래디언트 방법이 최악의 경우 다항 시간 내에 수렴할 수 있는가?
  • RQ2수렴 시간이 상태공간 크기 $|\mathcal{S}|$ 와 유효 수평 $1/(1-\gamma)$ 에 어떻게 의존하는가?
  • RQ3이전 연구에서 관찰된 소프트맥스 PG 방법의 명백한 글로벌 수렴성은 실용적 효율성을 보장하는 데 충분한가?
  • RQ4소프트맥스 PG가 수렴하기 위해 지수적으로 많은 반복을 요구하는 어려운 MDP 사례를 구성할 수 있는가?
  • RQ5유리한 초기화 및 유리한 탐색 조건 하에서도 지수 하한이 유지되는가?

주요 결과

  • 소프트맥스 정책 그래디언트 방법은 정확한 그래디언트 계산이 있음에도 불구하고 최소 $|1/\eta| \cdot |\mathcal{S}|^{2^{\Omega(1/(1-\gamma))}}$ 번의 반복이 필요로 하며, 이는 수렴을 보장한다.
  • 이 지수 하한은 유리한 정책 초기화와 유한한 분포 불일치를 가진 유리한 초기 상태 분포 조건 하에서도 유지된다.
  • 수렴 시간은 유효 수평 $1/(1-\gamma)$ 에 대해 초초기적으로 의존하며, 실생활에서 매우 클 수 있다.
  • 하한은 정책 업데이트의 재귀 분석을 통해 확립되었으며, 이는 시간이 지남에 따라 단계당 향상도 급격히 감소함을 보여준다.
  • 이 결과는 정책 확률이 열악한 행동에 대해 천천히 감소하는 3개의 행동을 가진 MDP에 기반한다.
  • 이 결과는 단순한 소프트맥스 PG 방법이 효율적으로 확장되지 않을 수 있음을 시사하며, 수렴 속도를 높이기 위해 수정된 업데이트 규칙 또는 정규화가 필요할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.