Skip to main content
QUICK REVIEW

[논문 리뷰] Decoupled Reinforcement Learning to Stabilise Intrinsically-Motivated Exploration

Lukas Schäfer, Filippos Christianos|arXiv (Cornell University)|2021. 07. 19.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 내재적 탐색과 외재적 이용을 위한 별도의 정책을 훈련하는 프레임워크인 분리 강화학습(DeRL)을 제안한다. 이는 내재적 보상 기반 탐색의 안정성을 높인다. 탐색과 이용을 분리함으로써 DeRL은 내재적 보상 초항수에 대한 더 뛰어난 내성적 저항성과 희소 보상 환경에서 더 빠른 수렴 속도 및 높은 샘플 효율성을 달성한다.

ABSTRACT

Intrinsic rewards can improve exploration in reinforcement learning, but the exploration process may suffer from instability caused by non-stationary reward shaping and strong dependency on hyperparameters. In this work, we introduce Decoupled RL (DeRL) as a general framework which trains separate policies for intrinsically-motivated exploration and exploitation. Such decoupling allows DeRL to leverage the benefits of intrinsic rewards for exploration while demonstrating improved robustness and sample efficiency. We evaluate DeRL algorithms in two sparse-reward environments with multiple types of intrinsic rewards. Our results show that DeRL is more robust to varying scale and rate of decay of intrinsic rewards and converges to the same evaluation returns than intrinsically-motivated baselines in fewer interactions. Lastly, we discuss the challenge of distribution shift and show that divergence constraint regularisers can successfully minimise instability caused by divergence of exploration and exploitation policies.

연구 동기 및 목표

  • 비정적 보상 형상화와 초항수 민감도로 인한 내재적 보상 기반 탐색의 불안정성 해결.
  • 내재적 보상 척도와 감쇠 비율에 대한 수동적 초항수 조정에 대한 의존도 감소.
  • 희소 보상 환경에서 샘플 효율성과 훈련 일관성 향상.
  • 탐색 정책 훈련을 이용 정책 최적화에서 분리하여 학습 안정화.
  • 탐색 정책과 이용 정책 간 분포 이탈의 영향을 조사하고, 분산을 완화하기 위한 정규화 기법 제안.

제안 방법

  • 외재적 보상 r^e 와 내재적 보상 r^i 를 조합한 보상 신호 r = r^e + λr^i 를 사용해 탐색 정책 πβ 를 훈련.
  • πβ 가 수집한 트레이젝터리에서 외재적 보상 r^e 만을 사용해 이용 정책 πe 를 훈련.
  • 오프-폴리시 및 온-폴리시 강화학습 알고리즘(예: SAC, A2C)을 사용해 πβ 와 πe 를 별도로 훈련.
  • πβ 와 πe 간 KL 발산 제약을 적용해 분포 이탈을 최소화하고 학습을 안정화.
  • 다양한 내재적 보상 유형 평가: 카운트 기반(Ostrovski et al.), 궁금함 기반(Pathak et al.), 내재적 궁금함(Burda et al.).
  • 정책 훈련을 분리해 내재적 보상의 영향이 주 정책 최적화에 미치는 영향를 분리하여 분석.

실험 결과

연구 질문

  • RQ1탐색과 이용을 분리함으로써 보상 척도와 감쇠 비율 등의 내재적 보상 초항수 민감도를 줄일 수 있는가?
  • RQ2표준 내재적 동기 부여 방법에 비해 DeRL 이 더 빠른 수렴 속도와 높은 샘플 효율성을 달성하는가?
  • RQ3탐색 정책과 이용 정책 간 분포 이탈이 학습 안정성에 어떤 영향을 미치는가?
  • RQ4분산 정규화(예: KL 제약)가 DeRL 훈련을 효과적으로 안정화시킬 수 있는가?
  • RQ5DeRL 이 다양한 내재적 보상 메커니즘과 희소 보상 환경에서 성능를 유지하는가?

주요 결과

  • DeRL 는 내재적 보상 기반 기준 모델과 동일한 최종 평가 수익을 달성하지만, 환경 상호작용 횟수를 크게 줄여 샘플 효율성이 뛰어나다.
  • DeepSea 10 환경에서 카운트 기반 내재적 보상과 함께 DeRL 은 모든 카운트 증분에서 최대 수익 0.99±0.00 을 달성했으며, 초항수 변화에 따라 표준 기준 모델보다 뛰어난 성능을 보였다.
  • KL 발산 제약(αβ = αe = 0.1)을 적용한 DeRL 은 내재적 보상 척도를 0.01 으로 낮춰도 안정된 성능을 유지했으며, 정규화되지 않은 설정에서 관찰된 붕괴 현상을 피했다.
  • Hallway 환경에서 제약 조건이 있는 DeRL 은 모든 카운트 증분에서 평균 수익 0.84±0.07 를 달성했고, 내재적 보상이 너무 작을 경우 정규화되지 않은 버전은 0.00±0.00 으로 붕괴되었다.
  • 내재적 보상만을 사용하는 DeRL (r = λr^i) 은 대부분의 설정에서 학습에 실패했으며, 이는 안정적인 이용을 위해 외재적 보상이 필수적임을 확인한다.
  • 이 방법은 내재적 보상 척도와 감쇠 비율에 대해 뛰어난 내성적 저항성을 보였으며, 0.01 에서 100.0 까지의 7개의 카운트 증분 값에서 일관된 성능을 유지했고, 표준 기준 모델은 극단적 설정에서 실패하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.