[논문 리뷰] Memory-efficient Reinforcement Learning with Value-based Knowledge Consolidation
이 논문은 타겟 Q-네트워크에서 현재 Q-네트워크로 지식을 통합함으로써 깊이 강화학습에서 치명적인 기억 상실을 줄이는 메모리 효율적인 강화학습 알고리즘인 MeDQN을 제안한다. 표준 DQN보다 최소 10배 작게 설정된 리PLAY 버퍼를 사용함으로써, 표본화된 환경과 이미지 기반 환경에서 비교적 또는 더 뛰어난 성능를 달성하며, 높은 샘플 효율성을 유지하면서도 메모리 사용을 크게 감소시킨다.
Artificial neural networks are promising for general function approximation but challenging to train on non-independent or non-identically distributed data due to catastrophic forgetting. The experience replay buffer, a standard component in deep reinforcement learning, is often used to reduce forgetting and improve sample efficiency by storing experiences in a large buffer and using them for training later. However, a large replay buffer results in a heavy memory burden, especially for onboard and edge devices with limited memory capacities. We propose memory-efficient reinforcement learning algorithms based on the deep Q-network algorithm to alleviate this problem. Our algorithms reduce forgetting and maintain high sample efficiency by consolidating knowledge from the target Q-network to the current Q-network. Compared to baseline methods, our algorithms achieve comparable or better performance in both feature-based and image-based tasks while easing the burden of large experience replay buffers.
연구 동기 및 목표
- 제한된 메모리 용량으로 인해 비i.i.d. 데이터에서 학습할 때 깊이 강화학습에서 치명적인 기억 상실 문제를 해결하기 위해.
- 온디바이스 및 엣지 RL 응용 분야에서 큰 경험 리PLAY 버퍼의 메모리 부담을 줄이기 위해.
- 대규모 데이터 저장소에 의존하지 않고도 높은 샘플 효율성과 학습 안정성을 유지하기 위해.
- 최소한의 메모리 오버헤드로 지속적 강화학습 환경에서 효과적인 지식 유지 가능성을 확보하기 위해.
제안 방법
- 타겟 Q-네트워크에서 현재 Q-네트워크로 가치 함수 지식을 전달하는 지식 통합 손실을 도입한다.
- 학습한 경험과 이전 지식을 유지하는 데 균형을 이루기 위해 조정 가능한 하이퍼파라미터를 사용한다.
- 큰 경험 리PLAY 버퍼를 균일 또는 실시간 상태 샘플링으로 대체하여 메모리 사용을 최대 10배 감소시킨다.
- 학습 업데이트 중에 통합 손실을 적용하여 학습 안정성을 높이고 기억 상실을 줄인다.
- 두 가지 변종을 설계: 균일 상태 샘플링을 위한 MeDQN(U)과 실시간 상태 샘플링을 위한 MeDQN(R)으로, 각각 다른 작업 유형에 최적화되어 있다.
- 표준 DQN 아키텍처를 유지하되, 학습 목표를 지식 통합을 포함하도록 수정하여 기존 프레임워크와의 호환성을 유지한다.
실험 결과
연구 질문
- RQ1큰 리PLAY 버퍼에 의존하지 않고도 타겟 네트워크에서 지식 통합이 DQN에서 기억 상실을 줄일 수 있는가?
- RQ2리PLAY 버퍼를 10배 작게 사용할 경우 MeDQN의 성능은 표준 DQN과 비교해 어떻게 되는가?
- RQ3지식 통합이 저차원 및 고차원 제어 작업 모두에서 샘플 효율성과 학습 안정성을 향상시키는가?
- RQ4MeDQN은 아케이드 게임 및 MinAtar와 같은 이미지 기반 환경에서 최소한의 메모리 사용으로 성능를 유지할 수 있는가?
- RQ5지속적 RL 환경에서 새로운 지식 학습과 과거 지식 기억 간의 최적 균형은 무엇인가?
주요 결과
- 100만 개의 버퍼 크기를 사용하는 표준 DQN보다 MeDQN(R)이 3개의 아케이드 게임(Name This Game, Phoenix, Qbert)에서 더 높은 성능를 보였다.
- Seaquest(.MinAtar)에서 MeDQN(R)은 10만 개의 버퍼로 25.82 ± 1.69의 리턴을 달성했고, DQN은 100만 개의 버퍼로 20.48 ± 0.75의 리턴을 기록했다.
- MeDQN(R)은 리PLAY 버퍼 메모리의 10퍼센트만 사용함에도 불구하고, 다른 두 아케이드 게임에서 DQN과 동일한 성능를 기록했다.
- 아케이드 게임에서 메모리 사용량이 7GB에서 0.7GB로 감소하여, 성능 저하 없이 10배의 메모리 프로파일 감소를 확인했다.
- MeDQN(U)과 MeDQN(R)은 기억 상실 감소와 더 적은 업데이트 횟수로 인해 계산 효율성이 향상되었다.
- 최소한의 메모리 오버헤드로 최신 기술 수준의 성능를 달성하였으며, 다양한 환경에서 뛰어난 강건성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.