Skip to main content
QUICK REVIEW

[논문 리뷰] The Impact of Non-stationarity on Generalisation in Deep Reinforcement Learning

Maximilian Igl, Gregory Farquhar|arXiv (Cornell University)|2020. 06. 10.
Reinforcement Learning in Robotics참고 문헌 28인용 수 15
한 줄 요약

이 논문은 함수 근사기를 사용하는 딥 강화학습에서 변화하는 정책과 변화하는 학습 목표로 인해 발생하는 비정상성(non-stationarity)이 일반화를 약화시키는 핵심 원인임을 규명한다. 이를 해결하기 위해 반복적 재학습(Iterated Relearning, ITER)을 제안하며, 이는 기존에 학습된 정책의 지식을 반복적으로 새로 초기화된 네트워크로 이전함으로써 비정상성을 감소시키고, ProcGen 및 Multiroom 벤치마크에서 성능을 향상시킨다.

ABSTRACT

Non-stationarity arises in Reinforcement Learning (RL) even in stationary environments. Most RL algorithms collect new data throughout training, using a non-stationary behaviour policy. Furthermore, training targets in RL can change even with a fixed state distribution when the policy, critic, or bootstrap values are updated. We study these types of non-stationarity in supervised learning settings as well as in RL, finding that they can lead to worse generalisation performance when using deep neural network function approximators. Consequently, to improve generalisation of deep RL agents, we propose Iterated Relearning (ITER). ITER augments standard RL training by repeated knowledge transfer of the current policy into a freshly initialised network, which thereby experiences less non-stationarity during training. Experimentally, we show that ITER improves performance on the challenging generalisation benchmarks ProcGen and Multiroom.

연구 동기 및 목표

  • 함수 근사기를 사용하는 딥 강화학습에서 정책과 학습 목표의 비정상성이 일반화에 부정적인 영향을 미치는 방식을 조사하기 위해.
  • 딥 네트워크를 사용한 지도학습 및 강화학습 환경에서 비정상성의 영향을 분석하기 위해.
  • 정책 학습 중 비정상성을 줄이는 학습 방법을 개발하여 일반화 성능을 향상시키기 위해.
  • ProcGen 및 Multiroom과 같은 도전적인 벤치마크에서 일반화 성능 향상의 실증적 검증을 수행하기 위해.

제안 방법

  • ITER는 학습 과정 중 비정상성을 줄이기 위해 현재 정책의 지식을 반복적으로 새로 초기화된 신경망으로 이전한다.
  • 이 방법은 정기적인 간격으로 기존에 학습된 네트워크의 정책 행동을 새롭게 초기화된 네트워크로 지식 정밀도(知識 distillation) 방식으로 이전한다.
  • 학습은 사이클 단위로 진행되며, 정책이 학습된 후 그 지식이 새로운 네트워크로 이전되고, 이후 해당 네트워크는 다시 처음부터 미세조정된다.
  • 이 과정은 학습 과정에서 비정상적인 목표와 행동 정책의 영향을 반복적으로 감소시킨다.
  • 이 접근법은 표준 RL 학습 목표를 유지하면서도, 주기적인 재초기화와 지식 이전을 도입하여 학습 동역학을 안정화시킨다.
  • 실험에서는 이 방법을 가치 기반 및 정책 기반 RL 알고리즘 양쪽에 적용하였다.

실험 결과

연구 질문

  • RQ1함수 근사기를 사용하는 딥 강화학습에서 정책과 학습 목표의 비정상성이 일반화에 어떤 영향을 미치는가?
  • RQ2새로 초기화된 네트워크에 지식 정밀도를 적용할 경우, 학습 중 비정상성이 얼마나 감소하는가?
  • RQ3반복적 재학습은 ProcGen 및 Multiroom과 같은 도전적이고 다양한 RL 벤치마크에서 일반화를 향상시킬 수 있는가?
  • RQ4샘플 효율성과 분포 이질성에 대한 저항성 측면에서, ITER는 표준 학습 방식보다 어떻게 비교되는가?
  • RQ5비정상성 감소가 다양한 환경에서 더 안정적이고 일반화 가능한 정책을 도출하는 데 기여하는가?

주요 결과

  • 함수 근사기를 사용하는 딥 강화학습에서 정책과 학습 목표의 비정상성은 정적 환경에서도 일반화 성능을 심각하게 떨어뜨린다.
  • ITER는 ProcGen 벤치마크에서 표준 학습 방식보다 더 높은 평균 및 중앙값 점수를 기록하며 성능 향상을 보였다.
  • Multiroom 환경에서는 검증되지 않은 테스트 레벨 전반에 걸쳐 ITER가 더 뛰어난 일반화 성능을 보이며, 더 높은 내구성을 입증하였다.
  • 이 방법은 비정상적인 목표와 행동 정책의 부정적 영향을 줄여 더 안정적인 학습 동역학을 이끌어냈다.
  • 새로 초기화된 네트워크에 지식을 이전하는 것은 학습 중 비정상성의 영향을 효과적으로 완화시켰다.
  • ITER는 기존의 RL 알고리즘 및 하이퍼파라미터를 수정하지 않더라도 다양한 환경에서 일관된 성능 향상을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.