[논문 리뷰] Remember and Forget for Experience Replay
이 논문은 경험 재생에서 현재 정책과 너무 다를 경우의 경험을 걸러내고 KL 발산 제약을 통해 정책 업데이트 속도를 조절함으로써 비정책 기반 딥 강화학습의 안정성과 성능을 향상시키는 새로운 경험 재생 방법인 Remember and Forget Experience Replay (ReF-ER)를 제안한다. ReF-ER는 연속 제어 벤치마크와 부분 관측 가능한 유체 역학 작업에서 DDPG, NAF, 비정책 기반 PG 방법에 대해 광범위하게 안정성과 성능을 향상시키며, 광범위한 초모수 조정 없이도 기능한다.
Experience replay (ER) is a fundamental component of off-policy deep reinforcement learning (RL). ER recalls experiences from past iterations to compute gradient estimates for the current policy, increasing data-efficiency. However, the accuracy of such updates may deteriorate when the policy diverges from past behaviors and can undermine the performance of ER. Many algorithms mitigate this issue by tuning hyper-parameters to slow down policy changes. An alternative is to actively enforce the similarity between policy and the experiences in the replay memory. We introduce Remember and Forget Experience Replay (ReF-ER), a novel method that can enhance RL algorithms with parameterized policies. ReF-ER (1) skips gradients computed from experiences that are too unlikely with the current policy and (2) regulates policy changes within a trust region of the replayed behaviors. We couple ReF-ER with Q-learning, deterministic policy gradient and off-policy gradient methods. We find that ReF-ER consistently improves the performance of continuous-action, off-policy RL on fully observable benchmarks and partially observable flow control problems.
연구 동기 및 목표
- 경험 재생 내 과거 경험과 정책 행동이 다를 경우 발생하는 비정책 기반 딥 강화학습의 불안정성과 성능 저하 문제를 해결하기 위해.
- 기울기 업데이트에만 '근접 정책' 경험을 선택적으로 사용함으로써 분산을 줄이고 데이터 효율성을 향상시키기 위해.
- KL 발산을 기반으로 한 신뢰 영역 제약을 통해 재생된 행동과의 정책 유사성을 유지하기 위해.
- 광범위한 초모수 조정 없이도 다양한 비정책 알고리즘(DDPG, NAF, 비정책 PG)에서 견고한 성능을 유지하기 위해.
- 표준 Gym 환경과 복잡한 부분 관측 가능한 유체 역학 시뮬레이션 모두에서의 효과성을 입증하기 위해.
제안 방법
- 중요도 가중치 비율 ρ = π^w(a|s)/μ(a|s)를 기반으로 경험을 '근접 정책' 또는 '원거리 정책'으로 분류하며, ρ는 정책의 다름을 측정한다.
- 사전 정의된 임계값 내에 ρ가 포함된 '근접 정책' 경험에서만 기울기 업데이트를 수행함으로써 오래된 또는 다를 경우의 행동으로 인한 잘못된 업데이트를 방지한다.
- 정책 업데이트를 제약하고 재생된 행동으로부터의 급격한 다름을 방지하기 위해 D_KL(μ || π^w)을 최소화하는 신뢰 영역 페널티를 도입한다.
- 훈련 중에 ρ의 임계값과 신뢰 영역 페널티를 점차 감소시켜 온정책과 유사한 업데이트의 정확도를 점차 높인다.
- Q-학습(NAF), 결정론적 정책 기울기(DDPG), 비정책 기반 정책 기울기(비정책 PG) 알고리즘과 원활하게 통합된다.
- 비마르코프 동역학을 다루기 위해 부분 관측 가능한 환경에서 LSTM 기반 함수 근사기 사용한다.
실험 결과
연구 질문
- RQ1원거리 정책 경험을 걸러내는 것이 비정책 기반 딥 강화학습 알고리즘의 안정성과 성능 향상에 기여하는가?
- RQ2KL 발산 제약을 통해 정책 업데이트 속도를 조절하면 학습 효율성과 데이터 활용도가 향상되는가?
- RQ3Task-특화 초모수 조정 없이도 ReF-ER가 다양한 비정책 알고리즘에서 성능 향상을 이끌 수 있는가?
- RQ4복잡한 동역학을 가진 부분 관측 가능한 환경, 예를 들어 유체 흐름 제어에서 ReF-ER는 어떻게 성능을 발휘하는가?
- RQ5고정밀 물리 시뮬레이션에서 ReF-ER는 더 빠른 수렴과 더 나은 최종 성능을 달성할 수 있는가?
주요 결과
- ReF-ER는 완전 관측 가능한 OpenAI Gym 벤치마크에서 DDPG, NAF, 비정책 PG 방법 전반에 걸쳐 일관되게 성능 향상을 이룬다.
- 부분 관측 가능한 2D 유량 제어 작업에서, ReF-ER를 사용한 DDPG는 표준 ER 및 다른 방법보다 더 적은 액추에이션 비용으로 위치를 유지하는 데 더 빨리 학습한다.
- V-RACER에 ReF-ER를 적용한 결과, ACER 및 표준 DDPG를 능가하는 최종 성능을 달성한다.
- 훈련 분산을 줄이고 광범위한 초모수 최적화 없이도 신뢰할 수 있는 학습을 가능하게 한다.
- ReF-ER의 신뢰 영역 구성 요소는 정책의 다름을 효과적으로 제한하여 시간이 지남에 따라 기울기 추정의 정확도를 향상시킨다.
- 비마르코프 환경에서 LSTM 기반 함수 근사기와 함께 ReF-ER는 안정적인 훈련을 가능하게 하여 복잡한 제어 작업을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.