Skip to main content
QUICK REVIEW

[논문 리뷰] CCLF: A Contrastive-Curiosity-Driven Learning Framework for Sample-Efficient Reinforcement Learning

Chenyu Sun, Hangwei Qian|arXiv (Cornell University)|2022. 05. 02.
Reinforcement Learning in Robotics참고 문헌 48인용 수 5
한 줄 요약

이 논문은 표본 효율성을 향상시키기 위해 미충분히 탐색된 경험을 우선시하고, 정보성 있는 데이터 증강을 선택하며, 놀라움 기반의 궁금증을 사용해 Q-네트워크와 인코더를 정규화함으로써 강화학습에서 표본 효율성을 높이는 모델에 종속되지 않는, 대비적-궁금증 기반의 프레임워크인 CCLF를 제안한다. 이는 DeepMind Control, Atari, MiniGrid 벤치마크에서 현저히 감소된 데이터 사용량과 함께 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In reinforcement learning (RL), it is challenging to learn directly from high-dimensional observations, where data augmentation has recently been shown to remedy this via encoding invariances from raw pixels. Nevertheless, we empirically find that not all samples are equally important and hence simply injecting more augmented inputs may instead cause instability in Q-learning. In this paper, we approach this problem systematically by developing a model-agnostic Contrastive-Curiosity-Driven Learning Framework (CCLF), which can fully exploit sample importance and improve learning efficiency in a self-supervised manner. Facilitated by the proposed contrastive curiosity, CCLF is capable of prioritizing the experience replay, selecting the most informative augmented inputs, and more importantly regularizing the Q-function as well as the encoder to concentrate more on under-learned data. Moreover, it encourages the agent to explore with a curiosity-based reward. As a result, the agent can focus on more informative samples and learn representation invariances more efficiently, with significantly reduced augmented inputs. We apply CCLF to several base RL algorithms and evaluate on the DeepMind Control Suite, Atari, and MiniGrid benchmarks, where our approach demonstrates superior sample efficiency and learning performances compared with other state-of-the-art methods.

연구 동기 및 목표

  • 높은 차원의 강화학습에서 균일한 데이터 증강의 비효율성을 해결하기 위해 학습에 있어 모든 샘플이 동일하게 중요한 것은 아님을 규명하는 것.
  • 미충분히 탐색되고 정보성 있는 경험을 우선시하는 자기지도 학습 기반의 궁금증 기반 메커니즘을 도입함으로써 표본 효율성과 학습 안정성을 향상시키는 것.
  • 경험 재생, 입력 선택, 정규화, 내재적 탐색의 네 가지 핵심 강화학습 구성 요소에 걸쳐 대비적 궁금증을 통합하는 모델에 종속되지 않는 프레임워크를 개발하는 것.
  • 과도한 증강 입력에 대한 의존도를 줄이면서도 원시 픽셀에서의 표현 불변성을 유지하고 일반화 능력을 향상시키는 것.
  • 낮은 분산과 높은 데이터 효율성으로 표준 강화학습 벤치마크에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • CCLF는 대비 표현 학습 모듈에서 예측 오차를 기반으로 한 대비 궁금증 신호를 도입하여, 네트워크 파rameter를 추가하지 않고도 CURL 손실을 재사용하여 놀라움을 정량화한다.
  • 대비 궁금증은 재생 버퍼 내 전이의 우선순위를 정하기 위해 사용되며, 더 놀라움이 많거나 학습이 덜 된 전이를 선호한다.
  • 예측 불확실성을 최대화하는 증강 입력을 선택함으로써 가장 정보성 있는 증강 입력을 이끌어내는 데 사용된다.
  • 궁금증 신호는 놀라움이 많고 탐색이 덜 된 관측치에 집중하도록 Q-함수와 인코더를 정규화한다.
  • 에이전트가 새로운 상태나 덜 학습된 상태를 탐색하도록 유도하기 위해 내재적 궁금증 기반 보상을 추가한다.
  • 이 프레임워크는 모듈러하고 모델에 종속되지 않는 방식으로 온정책 및 오프정책 강화학습 알고리즘 모두에 적용된다.
Figure 1 : C ontrastive- C uriosity-driven L earning F ramework (CCLF): a batch of transitions are sampled w.r.t. their prioritization weights. Image augmentation is performed to obtain $M$ augmented $o_{t}$ and $K$ augmented $o^{\prime}_{t}$ . The curiosity appraisal module quantitatively evaluates
Figure 1 : C ontrastive- C uriosity-driven L earning F ramework (CCLF): a batch of transitions are sampled w.r.t. their prioritization weights. Image augmentation is performed to obtain $M$ augmented $o_{t}$ and $K$ augmented $o^{\prime}_{t}$ . The curiosity appraisal module quantitatively evaluates

실험 결과

연구 질문

  • RQ1대비 표현 학습 기반의 자기지도 학습 궁금증 메커니즘이 딥 강화학습에서 표본 효율성을 향상시킬 수 있는가?
  • RQ2균일한 데이터 증강과 비교해, 탐색이 덜 된 상태와 정보성 있는 증강을 우선시하는 것이 더 안정적이고 효율적인 학습을 이끌 수 있는가?
  • RQ3경험 재생, 입력 선택, 정규화, 탐색의 강화학습 파이프라인의 여러 구성 요소에 대비 궁금증을 효과적으로 통합할 수 있는가? 이때 모델 복잡도가 증가하지는 않는가?
  • RQ4모든 네 가지 구성 요소에서 대비 궁금증을 공동으로 활용할 경우 학습 안정성과 최종 성능에 어떤 영향을 미치는가?
  • RQ5CCLF는 얼마나 많은 증강 입력을 줄일 수 있으며, 이로 인해 표현 불변성과 표본 효율성이 유지되거나 향상되는가?

주요 결과

  • 100K 환경 스텝에서 CCLF는 최고 성능을 보인 베이스라인(Reward+Selection)보다 평균 점수를 1.22배 높게 기록하여 뛰어난 표본 효율성을 입증한다.
  • 500K 스텝에서 CCLF는 최고의 점수(869 ± 9)를 기록하며 가장 낮은 표준편차(±9)를 보여 안정적이고 강건한 학습을 함을 시사한다.
  • 선택 또는 정규화 구성 요소를 제거할 경우 100K 스텝에서 성능이 29–33% 감소하고 분산이 증가하여 이들이 안정성과 효율성에 결정적인 역할을 한다는 것을 보여준다.
  • 보상 없이도 여러 베이스라인을 능가하는 성능을 기록함으로써 CCLF의 核심 이점은 내재적 보상 외에도 우선순위 정하기, 선택, 정규화에 기인함을 시사한다.
  • 과도한 데이터 증강이 필요 없도록 가장 정보성 있고 놀라운 샘플에 집중함으로써 데이터 효율성을 향상시키면서도 불변성 학습을 손상시키지 않는다.
  • 이 프레임워크는 DeepMind Control, Atari, MiniGrid를 포함한 다양한 벤치마크에서 효과적이며 광범위한 적용 가능성과 최신 기술 수준의 성능을 보여준다.
Figure 2 : Learning performances on the continuous control tasks from the DMC Suite (Selected). The proposed CCLF on SAC outperforms the other baseline methods in terms of sample efficiency and converges much faster, averaged by 6 random runs.
Figure 2 : Learning performances on the continuous control tasks from the DMC Suite (Selected). The proposed CCLF on SAC outperforms the other baseline methods in terms of sample efficiency and converges much faster, averaged by 6 random runs.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.