[논문 리뷰] Stochastic Recursive Momentum for Policy Gradient Methods
이 논문은 배치 교체가 필요 없이 분산 감소를 달성하는 데 있어 확률적 순환 모멘텀을 활용하는 새로운 정책 그래เดียน트 방법인 STORM-PG를 제안한다. 이는 기존의 최고 수준의 수렴 속도와 동일한 최적의 $O(1/\epsilon^3)$ 샘플 복잡도를 달성하면서도, 하이퍼파rameter 조정이 간편하고 기존의 분산 감소 기반 기준선들보다 뛰어난 경험적 성능을 보인다.
In this paper, we propose a novel algorithm named STOchastic Recursive Momentum for Policy Gradient (STORM-PG), which operates a SARAH-type stochastic recursive variance-reduced policy gradient in an exponential moving average fashion. STORM-PG enjoys a provably sharp $O(1/ε^3)$ sample complexity bound for STORM-PG, matching the best-known convergence rate for policy gradient algorithm. In the mean time, STORM-PG avoids the alternations between large batches and small batches which persists in comparable variance-reduced policy gradient methods, allowing considerably simpler parameter tuning. Numerical experiments depicts the superiority of our algorithm over comparative policy gradient algorithms.
연구 동기 및 목표
- 분포 이탈과 노이즈가 많은 그래디언트로 인한 정책 그래디언트 방법의 높은 샘플 복잡도와 분산 문제를 해결하기 위해.
- 분산 감소 정책 그래디언트 방법에서 큰 배치와 작은 배치를 번갈아 사용하는 것의 필요성을 제거하여 하이퍼파rameter 조정의 복잡성을 줄이기 위해.
- 재시작 메커니즘 없이도 전체 학습 과정에서 낮은 분산을 유지하는 안정적이고 효율적인 정책 그래디언트 알고리즘을 개발하기 위해.
- 강화 학습의 비볼록 스토하스틱 최적화 환경에서 최신 기술 수준의 수렴 속도를 달성하기 위해.
제안 방법
- STORM-PG는 지수 이동 평균을 사용하여 이전 그래디언트의 가중 평균을 순환적으로 추정하고 분산을 감소시키는 방식으로 STORM 분산 감소 프레임워크를 정책 그래디언트 방법에 통합한다.
- SVRPG 및 SRVRPG와 같은 기존 방법에서 사용하는 전통적인 배치 재시작 메커니즘을 대체하여 지속적이고 모멘텀 기반의 분산 안정화 방식을 구현한다.
- 알고리즘은 모멘텀 요소에 의해 제어되는 가중 평균을 사용해 과거 그래디언트의 순환 추정치를 유지한다.
- 학습률 감소 기능을 갖춘 Adam 최적화기와 함께 적응형 학습률을 사용함으로써 초기 학습률 선택에 대한 민감도를 감소시킨다.
- 고정된 미니배치 크기 $B$와 초기 큰 배치 크기 $S_0$를 사용하여 내부 루프 반복 수를 조정할 필요가 없도록 한다.
- 단일 은닉층을 가진 가우시안 정책을 사용하고, 다수의 독립적인 실행에 걸친 평균 수익을 통해 성능을 평가한다.
실험 결과
연구 질문
- RQ1배치 교체에 의존하지 않고도 최적의 $O(1/\epsilon^3)$ 수렴을 달성할 수 있는 분산 감소 정책 그래디언트 방법이 존재하는가?
- RQ2재시작 메커니즘 대신 지수 이동 평균을 사용하는 것이 학습 안정성 향상과 하이퍼파rameter 민감도 감소에 기여하는가?
- RQ3STORM-PG는 SVRPG 및 SRVRPG와 같은 기존의 분산 감소 기반 기준선들보다 수렴 속도와 최종 성능 모두에서 뛰어나게 성능을 발휘할 수 있는가?
- RQ4내부 루프 조정 없이도 제안된 방법이 하이퍼파rameter 선택에 대해 강건한가?
주요 결과
- STORM-PG는 $O(1/\epsilon^3)$ 샘플 복잡도 경계를 확보하여 정책 그래디언트 방법에서 알려진 최고 수준의 이론적 수렴 속도와 동일한 성능을 달성한다.
- 카트폴 환경에서 STORM-PG는 약 500개의 트레이젝터리에서 최적의 성능에 도달하며, SRVRPG 및 SVRPG는 약 1500개의 트레이젝터리가 필요하다.
- 마운틴카 작업에서 STORM-PG는 600개의 트레이젝터리 내에 안정화되고 우수한 성능을 달성하는 반면, 기준선들은 1000개 이상의 트레이젝터리가 필요로 하여 유사한 결과에 도달한다.
- STORM-PG는 미니배치 크기 $B$ 또는 내부 루프 반복 수 조정이 필요로 하지 않아, SVRPG 및 SRVRPG와 달리 하이퍼파rameter 민감도가 크게 감소함을 보였다.
- 다양한 환경에서 학습 안정성 향상과 더 빠른 수렴을 보이며, 반복 실행 시 평균 수익이 향상되고 신뢰구간이 더욱 좁아졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.