Skip to main content
QUICK REVIEW

[논문 리뷰] Geometric Entropic Exploration

Zhaohan Daniel Guo, Mohammad Gheshlaghi Azar|arXiv (Cornell University)|2021. 01. 06.
Robotic Path Planning Algorithms참고 문헌 47인용 수 8
한 줄 요약

이 논문은 상태 방문의 기하학적 인식 샤논 엔트로피를 노이즈 대비 추정 목적 함수를 사용해 최대화하는 새로운 강화학습 탐색 알고리즘인 기하학적 엔트로피 최대화(Geometric Entropy Maximisation, GEM)를 소개한다. GEM은 정책과 기하학적 유사도 함수를 동시에 학습함으로써 이산 및 연속 환경에서 효과적인 탐색을 가능하게 하여, RND 및 NGU와 같은 기존 방법들보다 희박 보상 작업에서 더 높은 상태 커버리지와 샘플 효율성을 확보한다.

ABSTRACT

Exploration is essential for solving complex Reinforcement Learning (RL) tasks. Maximum State-Visitation Entropy (MSVE) formulates the exploration problem as a well-defined policy optimization problem whose solution aims at visiting all states as uniformly as possible. This is in contrast to standard uncertainty-based approaches where exploration is transient and eventually vanishes. However, existing approaches to MSVE are theoretically justified only for discrete state-spaces as they are oblivious to the geometry of continuous domains. We address this challenge by introducing Geometric Entropy Maximisation (GEM), a new algorithm that maximises the geometry-aware Shannon entropy of state-visits in both discrete and continuous domains. Our key theoretical contribution is casting geometry-aware MSVE exploration as a tractable problem of optimising a simple and novel noise-contrastive objective function. In our experiments, we show the efficiency of GEM in solving several RL problems with sparse rewards, compared against other deep RL exploration approaches.

연구 동기 및 목표

  • 기존 최대 상태 방문 엔트로피(MSVE) 방법의 한계를 해결하기 위해, 이는 정의상 이산 상태 공간에서만 이론적으로 타당하며 연속 영역에서 기하학적 구조를 忽略한다는 점.
  • 이산 및 연속 상태 공간 양쪽에서 균일한 상태 방문을 유지할 수 있는 실용적이고 기하학적 인식 탐색 방법을 개발하기 위해.
  • 기하학적 인식 엔트로피 최대화에서의 유사도 함수 붕괴 및 비가역적 기울기 추정 문제를 극복하기 위해.
  • 통합 최적화 목적 함수를 통해 정적이고 확률적인 정책을 학습함으로써 전체 상태 공간을 균일하게 커버하는 안정적이고 퇴화되지 않는 탐색을 가능하게 하기 위해.
  • 학습된 유사도 함수가 상태 간 의미 있는 기하학적 관계를 포착하도록 보장하기 위해 인접성 정규화(Adjacency Regularisation)를 통합하기 위해.

제안 방법

  • GEM는 기하학적 인식 MSVE를 노이즈 대비 추정(NCE) 문제로 공식화하여, 정책과 상태 방문 분포의 공동 최적화를 위한 유계이고 편향 없는 기울기 추정을 가능하게 한다.
  • 학습된 유사도 함수 $k(x,x')$를 사용하여 기하학적 인식 샤논 엔트로피를 최대화하는 새로운 노이즈 대비 목적 함수를 도입한다.
  • 유사도 함수 $k$는 인접성 정규화(AR)를 통해 정규화되며, 이는 시간적으로 가까운 상태는 임베딩 상에서 가까이, 독립적으로 샘플된 상태는 떨어지게 하도록 유도한다.
  • GEM는 직접 엔트로피 최대화의 비가역성 문제를 피하기 위해 정책과 유사도 함수를 단일 미분 가능 목적 함수를 통해 공동 최적화한다.
  • 깊은 신경망 아키텍처를 사용하며, 공유 인코더(torso), 정책, 가치, 유사도 예측을 위한 별도의 헤드, 순차 처리를 위한 LSTM 코어를 포함한다.
  • 환경에 따라 하이퍼파rameter를 조정하며, 가중치 감쇠, 학습률, 내재 보상 스케일링 등을 포함한다. Adam 최적화기를 사용하여 총 100,000 단계 동안 학습을 수행한다.

실험 결과

연구 질문

  • RQ1기하학적 인식 엔트로피 최대화는 이산 및 연속 상태 공간 모두에서 실용적인 최적화 문제로 공식화될 수 있는가?
  • RQ2기하학적 구조를 忽略하는 비정상적인 형태로 붕괴되지 않도록 유사도 함수 $k$는 어떻게 학습할 수 있는가?
  • RQ3제안된 노이즈 대비 목적 함수는 희박 보상 환경에서 안정적이고 효과적인 탐색을 가능하게 하는가?
  • RQ4기존 탐색 방법인 RND 및 NGU와 비교해 GEM는 샘플 효율성과 상태 커버리지에서 어떻게 성능을 냈는가?
  • RQ5비대칭적이거나 역행 불가능한 전이를 가진 환경에서 AR 정규화는 기하학적 구조를 효과적으로 유지할 수 있는가?

주요 결과

  • GEM는 2-Rooms, 16-Leaves, CartPole Swingup, Mountain Car와 같은 희박 보상 환경에서 최신 기준 성능을 달성하며, RND 및 NGU보다 샘플 효율성과 최종 성능에서 뛰어난 성능을 보였다.
  • GEM에서 학습된 유사도 함수는 임베딩 공간에서 상태 구성의 의미 있는 클러스터링을 보여주며, 기하학적 구조를 성공적으로 포착했다. 이는 비대칭 전이 환경에서도 동일하게 성립한다.
  • 2-Keys 격자 환경에서 GEM는 열쇠 확보 상태와 문 상태에 따라 상태를 정확히 그룹화하며, 서로 다른 구성에 대해 구분 가능한 임베딩을 생성하여 기하학적 인식 능력을 입증했다.
  • 인접성 정규화(AR) 구성 요소는 유사도 함수 붕괴를 방지하고, 시간적으로 가까운 상태는 임베딩 상에서 가까이, 독립적인 샘플은 떨어지게 하여 상태 간의 기하학적 관계를 유지한다.
  • GEM는 보상의 퇴화 없이 일관된 탐색 행동을 유지하여, 에피소드 전반에 걸쳐 안정적이고 균일한 상태 방문을 보였다.
  • 정량적 결과는 GEM가 모든 평가된 환경에서 RND 및 NGU보다 더 높은 최종 수익을 달성하고 학습 곡선이 더 빠르게 수렴함을 보여주며, 어려운 탐색 과제에서 성공률 향상이 뚜렷하게 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.