Skip to main content
QUICK REVIEW

[논문 리뷰] Continual Reinforcement Learning with Multi-Timescale Replay

Christos Kaplanis, Claudia Clopath|arXiv (Cornell University)|2020. 04. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 28인용 수 9
한 줄 요약

이 논문은 다중 시간스케일 리プレイ(MTR) 버퍼를 제안하여, 다양한 시간스케일에서 경험을 유지함으로써 이른바 치명적인 기억 상실(catastrophic forgetting) 문제를 완화하고, 오래된 지식을 유지하면서도 새로운 데이터에 적응할 수 있도록 지속적 강화학습을 향상시킨다. 특히 불변 위험 최소화(IRM)와 조합된 MTR 프레임워크는 비정상적인 환경, 특히 중력이 변동하는 HalfCheetah 환경에서 기존의 기준 성능을 초월한다.

ABSTRACT

In this paper, we propose a multi-timescale replay (MTR) buffer for improving continual learning in RL agents faced with environments that are changing continuously over time at timescales that are unknown to the agent. The basic MTR buffer comprises a cascade of sub-buffers that accumulate experiences at different timescales, enabling the agent to improve the trade-off between adaptation to new data and retention of old knowledge. We also combine the MTR framework with invariant risk minimization, with the idea of encouraging the agent to learn a policy that is robust across the various environments it encounters over time. The MTR methods are evaluated in three different continual learning settings on two continuous control tasks and, in many cases, show improvement over the baselines.

연구 동기 및 목표

  • 분포 이탈의 시간스케일이 알려져 있지 않은 비정상적인 환경에서 작동하는 딥 강화학습 에이전트의 치명적인 기억 상실 문제를 해결한다.
  • 다양한 시간스케일에서 경험을 유지할 수 있도록 설계된 리플레이 버퍼를 개발하여, 새로운 데이터에 대한 적응과 오래된 지식의 유지 간의 균형을 이루도록 한다.
  • 지속적 변화하는 환경에서 다양한 환경 분포를 경험하는 정책을 학습하기 위해 불변 위험 최소화(IRM)와 MTR를 통합해 본다.
  • 작업 경계가 존재하지 않거나 탐지할 수 없는 지속적 학습 설정에서 MTR 프레임워크를 평가하여 실제 운영 환경의 제약 조건과 부합시킨다.

제안 방법

  • 다양한 시간 범위를 갖는 다양한 시간스케일에서 경험을 축적하는 하위버퍼의 계단식 구조를 설계하여, 다양한 시간 범위의 경험을 저장한다.
  • 동전 뒤집기 기반의 확률적 메모리 이동 메커니즘을 구현하여, 경험을 한 하위버퍼에서 다음으로 이동시키며 점진적인 기억 상실을 시뮬레이션한다.
  • 기억 유지 확률에 거듭제곱 법칙 감쇠를 적용하여 1/t 감쇠를 근사함으로써, 시간이 지남에 따라 기억 강도가 감소하는 심리학적 증거를 모델링한다.
  • MTR 버퍼를 불변 위험 최소화(IRM)와 조합하여, 시간이 지남에 따라 변화하는 다양한 환경 분포에 일반화할 수 있는 정책을 유도한다.
  • MTR 버퍼에서의 경험 리플레이를 통해 에이전트를 훈련시키며, 모든 하위버퍼에서 경험을 샘플링하여 오래된 데이터와 새로운 데이터의 균형 잡힌 분포를 유지한다.
  • 시간에 따라 변화하는 동역학(예: 중력 변화)이 있는 환경에서 연속 제어 과제(HalfCheetah 및 Ant)에 MTR 프레임워크를 적용하고, 세 가지 연속 학습 설정을 고려한다.

실험 결과

연구 질문

  • RQ1다양한 시간스케일에서 발생하는 분포 이탈이 알려져 있지 않은 환경에서 다중 시간스케일 리플레이 버퍼가 지속적 강화학습 성능을 향상시킬 수 있는가?
  • RQ2MTR 버퍼는 단일 시간스케일 또는 双시간스케일 리플레이 방법에 비해 기억 유지와 적응 간 균형을 얼마나 잘 달성하는가?
  • RQ3MTR와 불변 위험 최소화(IRM)를 조합하면 비정상적인 환경에서 더 강인한 정책을 얻을 수 있는가?
  • RQ4MTR 방법은 메모리 이동 확률 및 하위버퍼 수와 같은 하이퍼파라미터에 얼마나 민감한가?
  • RQ5어떤 유형의 환경에서 MTR-IRM 조합이 가장 큰 성능 향상을 보이는가?

주요 결과

  • 기본 MTR 에이전트는 HalfCheetah 및 Ant 과제에서 테스트된 모든 지속적 학습 설정에서 가장 일관된 성능을 보였다.
  • HalfCheetah 과제에서 더 비정상적인 설정 두 곳에서 MTR-IRM 에이전트가 가장 높은 성능을 기록했으며, 특히 중력이 변동하는 조건에서 두드러진 성능 향상을 보였다.
  • Ant 과제에서는 MTR-IRM 에이전트가 다른 방법들에 비해 성능이 열 劣하였으며, 이는 IRM의 유용성이 과제 특화된 동역학 및 환경 이탈 특성에 따라 달라질 수 있음을 시사한다.
  • MTR 버퍼의 기억 유지 확률은 1/t 감쇠를 근사하여 심리학적 기억 상실 모델과 일치한다.
  • 데이터 분포 변화가 예측 불가능하고 다양한 시간스케일에서 발생하는 환경에서 MTR는 치명적인 기억 상실을 효과적으로 완화한다.
  • MTR의 성능은 하이퍼파라미터 β_mtr(메모리 이동 확률)와 n_b(하위버퍼 수)에 민감함을 보이며, 정교한 튜닝이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.