[논문 리뷰] Return-Based Contrastive Representation Learning for Reinforcement Learning
이 논문은 귀환 신호를 사용하여 유사한 귀환을 가진 상태-행동 쌍과 다른 귀환을 가진 상태-행동 쌍을 구분할 수 있도록 표현을 학습하는 딥 강화학습에서의 새로운 대조 보조 과제인 귀환 기반 대조 표현 학습(RCRL)을 제안한다. RCRL은 Atari 및 DMControl 벤치마크에서 저자료 환경에서 샘플 효율성과 성능을 향상시키며, 강력한 베이스라인을 능가하고 기존 방법과 상호보완적으로 작용한다.
Recently, various auxiliary tasks have been proposed to accelerate representation learning and improve sample efficiency in deep reinforcement learning (RL). However, existing auxiliary tasks do not take the characteristics of RL problems into consideration and are unsupervised. By leveraging returns, the most important feedback signals in RL, we propose a novel auxiliary task that forces the learnt representations to discriminate state-action pairs with different returns. Our auxiliary loss is theoretically justified to learn representations that capture the structure of a new form of state-action abstraction, under which state-action pairs with similar return distributions are aggregated together. In low data regime, our algorithm outperforms strong baselines on complex tasks in Atari games and DeepMind Control suite, and achieves even better performance when combined with existing auxiliary tasks.
연구 동기 및 목표
- 저자료 환경에서 딥 강화학습의 샘플 비효율 문제를 해결하기 위해 귀환 인지 보조 과제를 도입하기 위해.
- 정책 π 하에서 귀환 분포가 유사한 상태-행동 쌍을 그룹화하는 새로운 상태-행동 추상화 기반의 이론적으로 탄탄한 표현 학습 방법을 개발하기 위해.
- 귀환 관련 특징는 유지하면서 귀환 비관련 특징에 대해 불변이 되도록 표현을 학습시켜 정책 학습을 향상시키기 위해.
- 귀환 기반 대조 학습이 기존 비지도 대조 방법과 효과적으로 조합되어 성능 향상을 이룰 수 있음을 보여주기 위해.
제안 방법
- RCRL은 귀환 유사성에 기반해 양성 및 음성 샘플을 구성한다: 양성 쌍은 동일하거나 유사한 귀환을 공유하고, 음성 쌍은 상이한 귀환을 가진다.
- 모멘터니 에너드와 예측 헤드를 사용하여 양성 및 음성 상태-행동 표현을 구별하는 대조 손실을 학습한다.
- 이 방법은 새로운 상태-행동 추상화인 Z^π-비의존성 추상화를 활용한다. 이는 정책 π 하에서 유사한 귀환 분포를 가진 상태-행동 쌍을 그룹화한다.
- Z-학습은 전체 귀환 분포 대신 샘플된 귀환을 사용하여 Z^π-비의존성 추상화를 근사함으로써 실용적인 학습을 가능하게 한다.
- 보조 손실은 동일한 가중치와 공유 학습률을 사용하여 주 RL 알고리즘(Rainbow, SAC 등)과 통합되어 하이퍼파rameter 민감도를 감소시킨다.
- 양성 쌍은 궤적 내 연속된 세그먼트에서 수집되어 귀환 유사성을 보장하고, 음성 쌍은 리play 메모리에서 무작위로 샘플된다.
실험 결과
연구 질문
- RQ1귀환 기반 대조 학습은 딥 강화학습에서 표현 품질과 샘플 효율성을 향상시킬 수 있는가?
- RQ2제안된 Z^π-비의존성 추상화는 상태-행동 공간의 효과적 크기를 줄이면서도 Q-값 정확도를 유지하는가?
- RQ3Atari 및 DMControl 환경에서 RCRL은 강력한 베이스라인 대비 저자료 환경에서 어떻게 성능을 발휘하는가?
- RQ4RCRL은 기존의 비지도 대조 방법과 효과적으로 조합되어 성능 향상을 이룰 수 있는가?
주요 결과
- 저자료 환경(100만 개의 상호작용)에서 RCRL은 55개 Atari 게임 중 53개에서 강력한 베이스라인을 능가하며, 중앙값으로 인간 정규화 점수 182.4%를 기록했다.
- DMControl 스위트에서 RCRL은 베이스라인 대비 뛰어난 성능을 보였으며, 복잡한 연속 제어 과제에서 두드러진 성과를 기록했다.
- 고자료 환경(150만 개의 상호작용)에서도 RCRL은 5개 Atari 게임 중 4개에서 베이스라인을 능가했으며, 이는 광범위한 적용 가능성을 시사한다.
- 표현 분석 결과, RCRL은 유사한 귀환 분포를 가진 경우 유사한 임베딩을 학습하고, 상이한 귀환을 가진 경우 상이한 임베딩을 학습함으로써 일반화 속도를 가속화하는 것으로 나타났다.
- 이 방법은 하이퍼파rameter 조정에 대해 강건하며, 보조 과제와 주 RL 과제에 동일한 손실 가중치와 학습률을 사용해도 성능 저하 없이 작동한다.
- CURL과 결합했을 때 RCRL는 더욱 뛰어난 성능을 기록했으며, 이는 존재하는 비지도 대조 방법과의 호환성과 상호보완성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.