[논문 리뷰] Regularized Anderson Acceleration for Off-Policy Deep Reinforcement Learning
이 논문은 오프정책 딥 강화 학습의 수렴 속도와 샘플 효율성을 향상시켜 학습을 가속화하기 위해 정규화된 앤더슨 가속화(RAA)를 제안한다. 함수 근사 오차를 완화하는 정규화 항을 포함한 정책 반복에 RAA를 적용함으로써, 기존 알고리즘을 수정하지 않고도 아타리 2600 및 머주코 벤치마크에서 학습 속도와 최종 성능을 크게 향상시킨다.
Model-free deep reinforcement learning (RL) algorithms have been widely used for a range of complex control tasks. However, slow convergence and sample inefficiency remain challenging problems in RL, especially when handling continuous and high-dimensional state spaces. To tackle this problem, we propose a general acceleration method for model-free, off-policy deep RL algorithms by drawing the idea underlying regularized Anderson acceleration (RAA), which is an effective approach to accelerating the solving of fixed point problems with perturbations. Specifically, we first explain how policy iteration can be applied directly with Anderson acceleration. Then we extend RAA to the case of deep RL by introducing a regularization term to control the impact of perturbation induced by function approximation errors. We further propose two strategies, i.e., progressive update and adaptive restart, to enhance the performance. The effectiveness of our method is evaluated on a variety of benchmark tasks, including Atari 2600 and MuJoCo. Experimental results show that our approach substantially improves both the learning speed and final performance of state-of-the-art deep RL algorithms.
연구 동기 및 목표
- 고차원 연속 상태 공간에서 특히 느린 수렴과 샘플 비효율성 문제를 해결하기 위해 모델-프리 오프정책 딥 강화 학습의 성능을 향상시키는 것.
- 고정점 반복을 가속화하는 데 쓰이는 앤더슨 가속화를, 함수 근사 오차에서 발생하는 편향을 다룰 수 있도록 딥 RL에 적응시키는 것.
- 기존 딥 RL 알고리즘(예: 듀얼링-DQN, TD3 등)과 호환되는 실용적이고 일반적인 목적의 가속화 프레임워크를 개발하는 것.
- 정규화 및 두 가지 새로운 전략인 점진적 업데이트와 적응형 재시작을 통해 안정성과 성능을 향상시키는 것.
제안 방법
- 최근의 가치 함수 추정치로부터 부분공간을 구성하고 잔차를 최소화하는 최적의 선형 조합을 선택함으로써, 정책 반복에 앤더슨 가속화를 적용한다.
- 계수 벡터의 노름을 제어하기 위해 티호노프 정규화 항을 도입함으로써, 함수 근사 오차의 영향을 줄인다.
- 점진적 업데이트를 제안하여 새로운 추정치를 서서히 가속화 과정에 통합함으로써 학습을 안정화시킨다.
- 성능이 정체될 경우 가속화 이력을 재설정하는 적응형 재시작을 구현함으로써 강건성을 향상시킨다.
- 디퓨얼링-DQN 및 TD3와 같은 오프정책 딥 RL 알고리즘에 RAA를 최소한의 아키텍처 수정으로 통합한다.
- 이론적 경계를 사용하여 정규화가 계수 벡터에 대한 근사 오차의 영향을 제한함을 보여준다.
실험 결과
연구 질문
- RQ1함수 근사 오차와 미니배치 샘플링 노이즈로 인해 딥 RL에 앤더슨 가속화를 효과적으로 적용할 수 있는가?
- RQ2RAA의 정규화는 딥 RL에서 근사 오차의 영향을 어떻게 제어하는가?
- RQ3점진적 업데이트와 적응형 재시작는 RAA의 안정성과 성능에 어떤 영향을 미치는가?
- RQ4RAA는 아타리 2600 및 머주코와 같은 다양한 딥 RL 벤치마크에서 학습 속도와 최종 성능를 어떻게 향상시키는가?
- RQ5학습률 및 정규화 스케일과 같은 하이퍼파라미터 설정에 대해 RAA는 얼마나 강건한가?
주요 결과
- RAA는 듀얼링-DQN과 TD3에서 학습을 크게 가속화하여 아타리 2600 및 머주코 환경에서 더 빠른 수렴과 더 높은 최종 성능를 달성한다.
- 제거 실험을 통해 점진적 업데이트가 모든 연속 제어 과제에서 학습 분산을 줄이는 데 필수적임을 확인한다.
- 적응형 재시작은 성능을 약간 향상시켜 수렴 정체기 처리에 있어 유의미한 가치를 지닌다.
- 다양한 학습률 설정에 대해 메서드가 강건하며, 최적화되지 않은 설정에서도 일관된 향상이 관찰된다.
- 이전 추정치의 수 m이 증가할수록 성능 향상이 발생하지만, m=5를 초과하면 수익이 감소함을 보여주며, 이는 비용과 이점 사이의 상충 관계를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.