[논문 리뷰] Variance Reduction for Deep Q-Learning using Stochastic Recursive Gradient
이 논문은 온라인 강화학습에서 정확도가 떨어지는 전체 기울기 앵커가 필요로 하지 않는 것을 목적으로 하며, 확률적 재귀 기울기(SRG)를 사용하여 기울기 분산을 줄이는 새로운 딥 Q-학습 알고리즘인 SRG-DQN을 제안한다. 기울기 추정치를 재귀적으로 업데이트하고 Adam 최적화를 통합함으로써, 기존의 SGD 및 SVRG 기반 기준선 대비 더 빠른 수렴 속도, 향상된 안정성 및 Atari 게임에서 뛰어난 성능을 달성한다.
Deep Q-learning algorithms often suffer from poor gradient estimations with an excessive variance, resulting in unstable training and poor sampling efficiency. Stochastic variance-reduced gradient methods such as SVRG have been applied to reduce the estimation variance (Zhao et al. 2019). However, due to the online instance generation nature of reinforcement learning, directly applying SVRG to deep Q-learning is facing the problem of the inaccurate estimation of the anchor points, which dramatically limits the potentials of SVRG. To address this issue and inspired by the recursive gradient variance reduction algorithm SARAH (Nguyen et al. 2017), this paper proposes to introduce the recursive framework for updating the stochastic gradient estimates in deep Q-learning, achieving a novel algorithm called SRG-DQN. Unlike the SVRG-based algorithms, SRG-DQN designs a recursive update of the stochastic gradient estimate. The parameter update is along an accumulated direction using the past stochastic gradient information, and therefore can get rid of the estimation of the full gradients as the anchors. Additionally, SRG-DQN involves the Adam process for further accelerating the training process. Theoretical analysis and the experimental results on well-known reinforcement learning tasks demonstrate the efficiency and effectiveness of the proposed SRG-DQN algorithm.
연구 동기 및 목표
- 고분산 기울기 추정치로 인한 딥 Q-학습의 불안정성과 낮은 샘플 효율성 문제를 해결하기 위해.
- 비 i.i.d.이고 동적으로 생성되는 전이 상태로 인해 온라인 강화학습에서 SVRG 기반 방법의 앵커 점 추정이 정확하지 않은 제한점을 극복하기 위해.
- 전체 기울기 계산을 피하기 위해 재귀적 기울기 업데이트를 사용하는 분산 감소 프레임워크를 설계하기 위해.
- 재귀적 기울기 추정과 적응형 최적화(Adam)를 통합하여 수렴 속도를 빠르게 하기 위해.
- 보상, 수렴 속도, 학습 안정성 측면에서 최신 DQN 변종 대비 제안된 방법의 우수성을 실증적으로 검증하기 위해.
제안 방법
- 외부 루프는 리PLAY 버퍼에서 N개의 전이를 샘플링하고, 내부 루프는 재귀적 기울기 업데이트를 수행하는 이중 루프 구조를 도입한다.
- SARAH에 영감을 얻은 재귀적 기울기 추정기법을 사용하여, 전체 배치 앵커에 의존하지 않고 과거 기울기 차이를 이용해 스트로스틱 기울기를 업데이트한다.
- SVRG의 앵커 점을 재귀적으로 업데이트된 추정치로 대체함으로써, 계산 비용이 높은 전체 기울기 계산이 필요 없도록 한다.
- 각 외부 루프의 끝에서 Adam 최적화기를 통합하여 수렴 속도를 가속화하고 파라미터 업데이트 방향을 향상시킨다.
- 재귀적 업데이트 규칙을 사용한다: $ g_{k} = g_{k-1} + \nabla f_{i_k}(\theta_k) - \nabla f_{i_k}(\theta_{k-1}) $, 이는 반복 과정 동안 기울기 정보를 누적한다.
- 이론적 분석을 통해 이 방법이 IFO에 대해 $ O(1/\varepsilon) $의 질의 복잡도로 $ \varepsilon $-최적 해를 달성함을 보여주며, 분산 감소 방법 중 최고의 알려진 비율을 달성한다.
실험 결과
연구 질문
- RQ1전체 기울기 앵커에 의존하지 않고 재귀적 기울기 추정이 온라인 딥 Q-학습에서 분산을 효과적으로 줄일 수 있는가?
- RQ2재귀적 기울기 업데이트 방식이 SVRG의 앵커 기반 접근 방식에 비해 기울기 정확도와 학습 안정성 측면에서 어떻게 비교되는가?
- RQ3재귀적 기울기 추정과 Adam 최적화의 조합이 Atari 환경에서 더 빠른 수렴과 향상된 성능을 이끌어내는가?
- RQ4기울기 표준편차 측정 기준으로 볼 때, SRG-DQN은 SVR-DQN에 비해 기울기 분산을 어느 정도 줄이는가?
- RQ5기존의 SGD 및 SVRG 기반 DQN 변종에 비해 제안된 방법이 더 뛰어난 샘플 효율성과 최종 성능을 달성할 수 있는가?
주요 결과
- 에피소드 평균 크기 실험에서, 표준 DQN에 비해 SRG-DQN은 더 빠른 수렴 속도와 더 낮은 에피소드 길이 표준편차를 달성한다.
- 재귀적 앵커와 정확한 앵커 간의 $ \ell_2 $ 거리가 크게 감소하여, 개선된 앵커 추정 정확도를 확인한다.
- 평균적으로, SRG-DQN은 첫 번째 레이어 파라미터의 기울기 표준편차를 SVR-DQN 대비 최대 50%까지 감소시키며, 특히 후반 학습 단계에서 뚜렷하다.
- Atari 게임 벤치마크에서, SRG-DQN은 최종 평균 보상 점수에서 SGD 기반 DQN과 SVR-DQN을 모두 능가하며, Breakout에서 최대 0.966, Q*bert에서 최대 0.632의 성과 향상을 기록한다.
- 재귀적 기울기 추정과 Adam 최적화의 조합은 SVR-DQN 대비 학습 시간을 30-40% 감소시키며, 성능을 유지하거나 향상시킨다.
- 실증 결과는 SRG-DQN이 기존의 분산 감소 기반 기준선보다 학습을 더 안정화시키고 분산을 더 효과적으로 줄임을 확인하며, 특히 고분산 및 비정적 환경에서 뚜렷하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.