[논문 리뷰] CoBERL: Contrastive BERT for Reinforcement Learning
CoBERL은 대조적 BERT 유사 표현 학습 목표와 게이팅된 LSTM-Transformer 아키텍처를 결합하여 강화학습에서의 데이터 효율성을 향상시킨다. 수동으로 설계된 증강 기법 없이도 마스크된 예측과 시간 도메인의 대조 손실을 활용함으로써, CoBERL은 아타리, 컨트롤 스위트, 3D 환경 전반에서 뛰어난 샘플 효율성과 성능을 달성하며, GTrXL과 같은 기존 기준 모델을 일관되게 능가한다.
Many reinforcement learning (RL) agents require a large amount of experience to solve tasks. We propose Contrastive BERT for RL (CoBERL), an agent that combines a new contrastive loss and a hybrid LSTM-transformer architecture to tackle the challenge of improving data efficiency. CoBERL enables efficient, robust learning from pixels across a wide range of domains. We use bidirectional masked prediction in combination with a generalization of recent contrastive methods to learn better representations for transformers in RL, without the need of hand engineered data augmentations. We find that CoBERL consistently improves performance across the full Atari suite, a set of control tasks and a challenging 3D environment.
연구 동기 및 목표
- 원시 픽셀에서의 딥 강화학습에서 더 나은 표현을 학습함으로써 데이터 효율성을 향상시키기.
- 큰 밀도 네트워크를 사용할 때 발생하는 노이즈가 많은 기울기와 강한 시간적 상관관계 문제를 해결하기.
- 수동으로 설계된 데이터 증강 기법을 피하는 자기지도 학습 표현 학습 방법 개발하기.
- 학습 가능한 게이트 메커니즘을 통해 LSTMs와 트랜스포머의 장점을 융합하여 동적 지식 활용 가능하게 하기.
- 2D 및 3D 제어 작업을 포함한 다양한 RL 환경에서 견고하고 일반화 가능한 표현 학습 가능하게 하기.
제안 방법
- BERT에서 영감을 얻은 이중 방향 마스크된 예측과 ReLIC의 시간 도메인 일반화를 결합한 새로운 대조 손실을 제안하여 자기지도 학습 표현 학습을 위한 목표를 설정한다.
- 관찰을 처리하고 마스크된 입력을 예측하기 위해 인과적으로 마스크된 게이팅된 트랜스포머-XL(GTrXL)을 사용하여 자동회귀 일관성 확보한다.
- GTrXL과 LSTMs의 출력을 융합하기 위한 학습 가능한 게이트 메커니즘을 도입하여 작업 요구에 따라 표현 경로를 동적으로 선택 가능하게 한다.
- 게이트를 RL 정책 손실을 사용하여 훈련하여 전체 아키텍처의 엔드 투 엔드 최적화 가능하게 한다.
- 예측된 마스크된 입력에서 얻은 정규화된 임베딩과 원본 관찰 간의 대조 손실을 적용하며, 인스턴스 식별과 불변성 페널티 기반의 대조 목표를 사용한다.
- 트랜스포머와 LSTMs 컴포넌트에 입력하기 전에 원시 픽셀 관찰을 임베딩하기 위해 잔차 컨볼루션 네트워크 인코더를 사용한다.
실험 결과
연구 질문
- RQ1BERT에서 영감을 얻은 대조적 표현 학습 목표는 수동으로 설계된 데이터 증강 기법 없이도 강화학습에서의 데이터 효율성을 향상시킬 수 있는가?
- RQ2학습 가능한 게이트를 통해 LSTMs와 트랜스포머를 융합할 경우 다양한 RL 환경에서 성능과 샘플 효율성에 어떤 영향을 미치는가?
- RQ3시간 도메인에서 마스크된 예측과 대조 학습을 융합할 경우, RL에서 더 일관되고 일반화 가능한 표현이 도출되는가?
- RQ4CoBERL은 여러 벤치마크 환경에서 GTrXL과 같은 기존 아키텍처를 어느 정도 능가하는가?
- RQ5마스크 비율이 보조 사전학습 목표와 최종 RL 성능에 어떤 영향을 미치는가?
주요 결과
- CoBERL은 모든 57개의 아타리 게임에서 일관된 데이터 효율성 향상을 기록하며, 샘플 효율성 측면에서 뚜렷한 성능 향상을 보였다.
- 딥마인드 컨트롤 스위트에서 CoBERL은 GTrXL 및 기타 기준 모델 대비 더 높은 샘플 효율성과 더 높은 최종 점수를 기록했다.
- 3D DMLab-30 환경에서 CoBERL은 더 뛰어난 기억력과 추론 능력을 보였으며, AUC 기준으로 GTrXL을 능가했다 (t(60) = 2.616, p = 0.0011).
- 절단 실험을 통해 대조 손실과 게이팅 아키텍처가 성능 향상에 독립적으로 기여하는 것으로 확인되었으며, 특히 표현 학습에서 대조 목표가 매우 효과적인 것으로 나타났다.
- 높은 마스크 비율(예: 50%)은 성능을 떨어뜨리며, 이는 보조 작업에 유용한 시간적 맥락을 감소시키기 때문임을 시사한다.
- 메서드가 도메인 간으로 잘 일반화되며, 2D 플랫포머와 3D 1인칭/3인칭 제어 작업 모두에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.