Skip to main content
QUICK REVIEW

[논문 리뷰] Policy Consolidation for Continual Reinforcement Learning

Christos Kaplanis, Murray Shanahan|arXiv (Cornell University)|2019. 02. 01.
Domain Adaptation and Few-Shot Learning인용 수 10
한 줄 요약

이 논문은 다중 시간스케일에서 은닉 네트워크의 캐스케이드를 사용해 에이전트의 정책을 희석시키는 방식으로 재난적 기억 상실을 완화하는 지속적 강화학습 방법인 정책 통합(Policy Consolidation, PC)을 제안한다. 이 방법은 작업 경계나 분포 이질성에 대한 사전 지식이 없이도 단일 작업, 번갈아가는 작업, 다중 에이전트 자가대전 환경에서 지속적 학습 성능을 향상시킨다.

ABSTRACT

We propose a method for tackling catastrophic forgetting in deep reinforcement learning that is extit{agnostic} to the timescale of changes in the distribution of experiences, does not require knowledge of task boundaries, and can adapt in extit{continuously} changing environments. In our extit{policy consolidation} model, the policy network interacts with a cascade of hidden networks that simultaneously remember the agent's policy at a range of timescales and regularise the current policy by its own history, thereby improving its ability to learn without forgetting. We find that the model improves continual learning relative to baselines on a number of continuous control tasks in single-task, alternating two-task, and multi-agent competitive self-play settings.

연구 동기 및 목표

  • 데이터 분포가 시간이 지남에 따라 지속적으로 변화하는 환경에서 딥 강화학습에서 재난적 기억 상실을 해결한다.
  • 작업 경계나 사전 정의된 작업 분할에 의존하지 않는 방법을 개발한다.
  • 변동성이 있는 환경, 예를 들어 동적 특성이 변화하는 단일 작업 학습 및 다중 에이전트 자가대전 환경에서의 지속적 학습을 가능하게 한다.
  • 다중 시간스케일 지식 희석을 활용해 정책 유지 및 성능 향상을 도모한다.
  • 다양한 강화학습 설정에서 효과적으로 작동하는 확장 가능하고 작업에 종속되지 않은 지속적 학습 접근법을 설계한다.

제안 방법

  • 최근부터 장기까지 다양한 시간스케일에서 정책 표현을 유지하는 은닉 네트워크의 캐스케이드를 구현한다.
  • 정책 네트워크와 각 은닉 네트워크 간 이중 방향 지식 희석을 사용하여 이전 지식으로 현재 정책을 정규화한다.
  • 학습을 안정화하고 정책 업데이트를 제어하기 위해 근접 정책 최적화(PPO)를 통합한다.
  • 정책과 각 은닉 네트워크 간 행동 분포를 정렬하기 위해 KL 발산을 사용해 지식 희석을 적용한다.
  • 정책 변화가 크지 않도록 제약을 두는 서브stituted 목표함수를 사용해 정책 네트워크를 훈련시켜 안정성을 확보한다.
  • 다양한 시간스케일에서 동적으로 은닉 네트워크를 업데이트하여 단기적이고 장기적인 정책 행동을 모두 포착한다.

실험 결과

연구 질문

  • RQ1데이터 분포가 지속적으로 변화하는 환경에서 작업 경계가 없는 상황에서도 지속적 강화학습 에이전트가 이전에 학습한 작업의 성능을 유지할 수 있는가?
  • RQ2다양한 강화학습 환경에서 다중 시간스케일 정책 희석이 재난적 기억 상실을 얼마나 효과적으로 감소시키는가?
  • RQ3작업 경계 감지 기능의 부재가 지속적 학습의 강건성과 일반화 능력에 영향을 주는가?
  • RQ4자기대전 및 번갈아가는 작업과 같은 변동성이 있는 설정에서 Policy Consolidation은 기존의 지속적 학습 기준 모델보다 어떻게 비교되는가?
  • RQ5점진적이고 비단순적인 분포 이질성이 발생하는 환경에서도 이 방법이 효과적으로 적용될 수 있는가?

주요 결과

  • PC 모델은 단일 작업, 번갈아가는 두 가지 작업, 다중 에이전트 자가대전를 포함한 모든 평가 환경에서 지속적 학습 성능을 크게 향상시켰다.
  • 번갈아가는 두 가지 작업 환경에서, PC는 작업 경계 감지 없이도 이전에 학습한 작업의 성능 유지에서 기준 모델을 능가했다.
  • 환경의 동역학이 점진적으로 변화하더라도, 다중 시간스케일 희석을 통해 정책 업데이트를 안정화시킴으로써 재난적 기억 상실을 감소시켰다.
  • 변동성이 있는 학습 환경에서 표준 PPO 및 다른 지속적 학습 기준 모델에 비해 평균 수익이 더 높은 성능을 기록했다.
  • 실험 결과, 은닉 네트워크의 캐스케이드가 시간스케일을 넘어 정책 지식을 효과적으로 유지함으로써 장기적 기억 유지에 기여함을 보였다.
  • 모델는 예측 불가능한 데이터 분포 변화에 강건하며, 환경이 언제 또는 어떻게 변화하는지에 대한 사전 지식이 필요하지 않다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.