[논문 리뷰] State Entropy Maximization with Random Encoders for Efficient Exploration
이 논문은 고차원 관측 공간에서 안정적이고 확장 가능한 엔트로피 추정을 가능하게 하기 위해 고정된 랜덤 인코더를 사용하여 저차원 표현을 추출함으로써 상태 엔트로피를 최대화하는 계산 효율적인 탐색 방법인 RE3을 제안한다. RE3은 DeepMind Control Suite, MiniGrid, Atari 벤치마크에서 모델-프리 및 모델-기반 강화학습 모두에서 샘플 효율성을 크게 향상시키며, 학습된 표현이나 보조 모델을 필요로 하는 기존 방법들을 능가한다.
Recent exploration methods have proven to be a recipe for improving sample-efficiency in deep reinforcement learning (RL). However, efficient exploration in high-dimensional observation spaces still remains a challenge. This paper presents Random Encoders for Efficient Exploration (RE3), an exploration method that utilizes state entropy as an intrinsic reward. In order to estimate state entropy in environments with high-dimensional observations, we utilize a k-nearest neighbor entropy estimator in the low-dimensional representation space of a convolutional encoder. In particular, we find that the state entropy can be estimated in a stable and compute-efficient manner by utilizing a randomly initialized encoder, which is fixed throughout training. Our experiments show that RE3 significantly improves the sample-efficiency of both model-free and model-based RL methods on locomotion and navigation tasks from DeepMind Control Suite and MiniGrid benchmarks. We also show that RE3 allows learning diverse behaviors without extrinsic rewards, effectively improving sample-efficiency in downstream tasks. Source code and videos are available at https://sites.google.com/view/re3-rl.
연구 동기 및 목표
- 딥 강화학습에서 흔히 발생하는 고차원 관측 공간에서의 효율적 탐색 문제를 해결하기 위해.
- 표현 학습이나 보조 모델을 요구하지 않으면서도 안정적이고 계산 효율적인 상태 엔트로피 추정을 가능하게 하기 위해.
- 랜덤으로 초기화된 인코더가 상태 엔트로피 추정을 위한 의미 있는 표현을 제공할 수 있는지 조사하기 위해.
- 상태 엔트로피 기반 내재 보상 설계를 통해 모델-프리 및 모델-기반 강화학습 알고리즘의 샘플 효율성을 향상시키기 위해.
- 희박 보상 환경에서 다양한 행동을 유도함으로써 후속 작업에 대한 효과적인 사전 학습을 가능하게 하기 위해.
제안 방법
- 랜덤으로 초기화된 컨볼루션 인코더의 잠재 공간에서 k-최근접 이웃(k-NN) 엔트로피 추정기를 사용하여 상태 엔트로피를 추정한다.
- 학습 전반에 걸쳐 인코더 가중치를 고정함으로써 기울기 업데이트 또는 표현 학습 목표의 필요성을 제거한다.
- 고정된 잠재 표현에 대해 k-NN 추정기를 적용하여 상태 엔트로피 비례의 내재 보상을 계산한다.
- 정책 또는 가치 함수 학습 과정을 수정하지 않고도 표준 강화학습 알고리즘(A2C, SAC 등)에 내재 보상을 통합한다.
- 컨볼루션 아키텍처의 인덕티브 바이어스를 활용하여 학습 없이도 의미 있는 상태 유사도 표현을 보장한다.
- 최소한의 하이퍼파라미터 튜닝으로 모델-프리(A2C, SAC), 모델-기반(Dreamer), 온-폴리시 설정 전반에 걸쳐 적용한다.
실험 결과
연구 질문
- RQ1고정된 랜덤으로 초기화된 인코더가 고차원 환경에서 상태 엔트로피 추정을 위한 안정적이고 의미 있는 표현 공간을 제공할 수 있는가?
- RQ2고정된 랜덤 인코더 공간에서 k-NN 추정을 통해 상태 엔트로피를 최대화하면 딥 강화학습에서 샘플 효율성이 향상되는가?
- RQ3학습된 표현이나 보조 모델에 의존하는 최신 탐색 방법들과 비교해 RE3는 어떻게 성능을 내는가?
- RQ4RE3는 희박 보상 환경에서 다양한 행동을 유도함으로써 후속 작업에 대한 효과적인 사전 학습을 가능하게 할 수 있는가?
- RQ5RE3는 몰입감 있는 시각적 환경인 Atari 게임과 같은 복잡한 환경에서도 확장 가능하고 효과적인가?
주요 결과
- DoorKey-8x8 MiniGrid 환경에서 RE3는 240만 번째 환경 스텝에서 평균 에피소드 리워드 0.49를 기록했으며, A2C + ICM(0.20) 및 A2C + RND는 비정상적인 정책 학습에 실패했다.
- MiniGrid Empty-16x16 환경에서 RE3는 사전 학습을 가능하게 하여 후속 테스트 성능을 향상시키며, A2C + RE3 + PT가 DoorKey 작업에서 뛰어난 샘플 효율성을 보였다.
- Atari 게임에서는 RE3가 Rainbow 및 Rainbow + SE(대조적 학습)보다 샘플 효율성을 향상시켰으며, 특히 몬테주마의 복수성 같은 어려운 탐색 게임에서 두각을 나타냈다.
- 데이터 증강이 압축된 상태 표현과 호환되지 않는 MiniGrid 환경에서, RE3는 표현 학습이 필요한 방법들보다 뛰어난 성능을 보였다.
- 이 방법은 계산적으로 효율적이며, 인코더에 대한 기울기 업데이트가 필요 없어 기존 RL 파ip라인에 통합하기 위해 확장 가능하고 실용적이다.
- 외부 보상 없이도 다양한 행동을 학습할 수 있으며, 큰 비어 있는 상태 공간에서 효과적인 내재 탐색을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.