Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Bottleneck for Robust Self-Supervised Exploration

Chenjia Bai, Lingxiao Wang|arXiv (Cornell University)|2021. 10. 20.
Reinforcement Learning in Robotics참고 문헌 58인용 수 13
한 줄 요약

이 논문은 정보 버블 원리에 따라 동역학과 관련된 표현을 학습함으로써 노이즈를 걸러내는 자기지도 탐색 방법인 동적 병목(Dynamic Bottleneck, DB)을 제안한다. 잠재 표현과 다음 상태 간의 상호정보량을 최대화하면서 관련 없는 상태-행동 의존성을 최소화함으로써, DB-보너스는 정보 획득 기반의 내재적 신선도를 측정하며, 희소 보상이 주어지는 노이즈가 많은 Atari 환경에서 최신 기법들을 능가한다.

ABSTRACT

Exploration methods based on pseudo-count of transitions or curiosity of dynamics have achieved promising results in solving reinforcement learning with sparse rewards. However, such methods are usually sensitive to environmental dynamics-irrelevant information, e.g., white-noise. To handle such dynamics-irrelevant information, we propose a Dynamic Bottleneck (DB) model, which attains a dynamics-relevant representation based on the information-bottleneck principle. Based on the DB model, we further propose DB-bonus, which encourages the agent to explore state-action pairs with high information gain. We establish theoretical connections between the proposed DB-bonus, the upper confidence bound (UCB) for linear case, and the visiting count for tabular case. We evaluate the proposed method on Atari suits with dynamics-irrelevant noises. Our experiments show that exploration with DB bonus outperforms several state-of-the-art exploration methods in noisy environments.

연구 동기 및 목표

  • 카메라 노이즈나 무작위 운동과 같은 동역학과 관련 없는 노이즈가 존재하는 환경에서 기존의 내재적 호기심 및 가짜 카운트 방법의 불안정성을 해결하기 위해.
  • 정보 버블 원리를 적용하여 동역학과 관련된 특징만을 포착하는 표현 학습 방법을 개발하기 위해.
  • 동역학과 관련된 표현에서의 정보 획득 기반으로 상태-행동의 새로운 정도를 측정하는 새로운 내재 보너스인 DB-보너스를 설계하기 위해.
  • 선형 MDP에서 DB-보너스와 UCB, 표본화된 MDP에서 방문 수와의 이론적 연결 고리를 설정하기 위해.
  • 특히 Montezuma’s Revenge와 같은 희소 보상 환경에서, 노이즈 있는 동역학 하에서 DB-보너스의 강건성과 효과성을 평가하기 위해.

제안 방법

  • DB 모델은 정보 버블 원리를 사용하여 상태-행동 쌍 $ (S_t, A_t) $ 의 잠재 표현 $ Z_t $ 를 학습하며, 다음 상태와의 상호정보량 $ I(Z_t; S_{t+1}) $ 를 최대화한다.
  • 입력과 표현 간의 상호정보량 $ I([S_t, A_t]; Z_t) $ 를 최소화하여 동역학과 관련 없는 특징을 압축한다.
  • 대조 학습을 통해 $ I(Z_t; S_{t+1}) $ 의 하한을 최적화함으로써, 분리된 동역학과 관련된 표현을 학습할 수 있도록 한다.
  • DB-보너스는 학습된 DB 표현에 대해 상태-행동 쌍의 정보 획득 기반으로 계산되며, 높은 불확실성의 전이를 장려한다.
  • 표현의 분리와 예측 성능을 동시에 확보하기 위해 이중 목적을 사용하여 엔드 투 엔드로 학습한다: 상호정보량 최소화를 통한 표현 분리와 상호정보량 최대화를 통한 예측 성능 향상.
  • 이론적으로 DB-보너스와 선형 MDP에서의 UCB, 표본화된 MDP에서의 방문 수 간의 연결 고리를 설정하여, 증명 가능한 효율적 탐색과의 일치성을 보여준다.

실험 결과

연구 질문

  • RQ1정보 버블 원리에 기반한 표현 학습 방법이 강화학습에서 동역학과 관련 없는 노이즈를 효과적으로 걸러낼 수 있는가?
  • RQ2제안된 DB-보너스는 이론적 기반과 실증 성능 측면에서 UCB 및 방문 수와 비교해 어떻게 다른가?
  • RQ3노이즈가 주입된 환경에서 기존의 호기심 및 가짜 카운트 방법보다 DB-보너스가 더 강건한 탐색을 이끌 수 있는가?
  • RQ4희소 보상이 존재하는 복잡한 환경인 Montezuma’s Revenge에서도 DB 모델이 의미 있는 분리된 표현을 학습할 수 있는가?
  • RQ5노이즈 및 끈적한 행동 조건 하에서 DB-보너스의 성능은 엔트로피 기반 탐색 방법과 비교해 어떻게 되는가?

주요 결과

  • 동역학과 관련 없는 노이즈가 주입된 Random-Box Atari 환경에서, DB-보너스는 여러 최신 탐색 기법을 능가하며 노이즈에 대한 강건성을 입증한다.
  • 자기지도 학습 하에서 DB-보너스는 Montezuma’s Revenge의 첫 번째 방의 절반을 통과시키며, 모든 기준 모델이 점수를 0으로 기록한 반면 성공을 거둔다.
  • t-SNE 시각화 결과, DB 표현은 의미 있는 의미적 군집(예: 점프, 하강, 탈출)을 형성하는 반면, 원시 상태는 이러한 군집이 없음을 확인한다.
  • 끈적한 행동이 존재하는 환경에서도 높은 성능를 보이며, 행동 왜곡에 대한 저항력을 보여준다.
  • 엔트로피 기반 방법인 RE3와 달리, 노이즈로 인해 상태 엔트로피가 증가함에도 불구하고 DB-보너스는 효과를 유지하며 노이즈에 강건함을 입증한다.
  • Gopher 환경에서의 스파이크 분석 결과, 높은 DB-보너스 이벤트는 희귀하고 영향력 있는 전이(예: 고릴라가 구멍을 파는 것)와 관련되어 있으며, 이는 높은 보상을 획득하는 데 핵심적인 역할을 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.