Skip to main content
QUICK REVIEW

[논문 리뷰] BeBold: Exploration Beyond the Boundary of Explored Regions

Tianjun Zhang, Huazhe Xu|arXiv (Cornell University)|2020. 12. 15.
Reinforcement Learning in Robotics참고 문헌 55인용 수 18
한 줄 요약

BeBold는 탐색된 영역을 초월하여 탐색을 이끄는 새로운 내재 보상(IR) 메커니즘을 제안한다. 이 메커니즘은 연속된 상태 간의 역 방문 빈도 차이를 규제하여, 계수 기반 방법에서의 단기적 시야, 탈락 문제를 완화한다. 이는 교육 과정 없이 120M 환경 스텝 내에 가장 도전적인 12개의 프로시저적 생성 MiniGrid 작업을 모두 해결하며 최신 기준 성능을 달성한다.

ABSTRACT

Efficient exploration under sparse rewards remains a key challenge in deep reinforcement learning. To guide exploration, previous work makes extensive use of intrinsic reward (IR). There are many heuristics for IR, including visitation counts, curiosity, and state-difference. In this paper, we analyze the pros and cons of each method and propose the regulated difference of inverse visitation counts as a simple but effective criterion for IR. The criterion helps the agent explore Beyond the Boundary of explored regions and mitigates common issues in count-based methods, such as short-sightedness and detachment. The resulting method, BeBold, solves the 12 most challenging procedurally-generated tasks in MiniGrid with just 120M environment steps, without any curriculum learning. In comparison, the previous SoTA only solves 50% of the tasks. BeBold also achieves SoTA on multiple tasks in NetHack, a popular rogue-like game that contains more challenging procedurally-generated environments.

연구 동기 및 목표

  • 희박한 보상 환경에서 딥 강화학습의 효율적 탐색 문제를 해결하기 위해.
  • 기존 내재 보상 방법의 한계, 즉 단기적 시야, 탈락, 상태 차이 접근법에서의 渐近적 일致성 문제를 극복하기 위해.
  • 탐색 영역의 경계를 초월하도록 유도하는 단순하면서도 효과적인 탐색 기준을 개발하기 위해.
  • 교육 과정 없이도 MiniGrid나 NetHack과 같은 도전적인 프로시저적 환경에서 최신 기준 성능을 달성하기 위해.

제안 방법

  • 궤적 내 연속된 상태 간의 역 방문 빈도 차이의 규제된 값을 기반으로 한 새로운 내재 보상을 제안한다.
  • 역 방문 빈도를 효율적이고 확장 가능한 방법으로 추정하기 위해 Random Network Distillation(RND)을 사용한다.
  • 내재 보상으로 max(1/N(s_{t+1}) - 1/N(s_t), 0)을 정의하며, 여기서 N(s)는 상태 s의 방문 빈도이다. 이는 탐색의 전초에서 높은 보상을 보장한다.
  • 임의의 환경 동역학으로 인한 잘못된 보상 방지를 위해 '규제된' 차이를 도입하여 안정성을 향상시킨다.
  • 효율적인 온정책 추적을 위해 에피소드 기반 방문 빈도를 유지하기 위해 해시 테이블을 사용한다.
  • 모든 환경에서 동일한 아키텍처와 하이퍼파라미터를 공유하는 표준 딥 강화학습 프레임워크에 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1간단한 계수 기반 내재 보상 메커니즘이 탐색 영역의 경계를 초월해 탐색을 효과적으로 이끄는가?
  • RQ2역 방문 빈도의 규제된 차이가 기존 IR 방법에 비해 단기적 시야와 탈락 문제를 얼마나 효과적으로 완화하는가?
  • RQ3이 방법이 교육 과정 없이도 MiniGrid나 NetHack과 같은 도전적인 프로시저적 환경에서 최신 기준 성능을 달성할 수 있는가?
  • RQ4이 방법이 높은 엔트로피 또는 노이즈가 많은 동역학을 가진 환경, 특히 확률적 환경에 얼마나 일반화되는가?

주요 결과

  • BeBold는 120만 환경 스텝 이내에 가장 도전적인 12개의 프로시저적 생성 MiniGrid 작업을 모두 해결하며, 이전 최신 기준 성능이 더 쉬운 작업들 중 50%만 해결한 것에 비해 100% 성공률를 달성한다.
  • MonteZuma’s Revenge에서 RND와 RIDE를 모두 초월하며, RNN 기반 모델을 사용해 약 13,000의 외재적 수익을 달성한다. 이는 RND의 4,400을 뛰어넘는 성과이다.
  • BeBold는 계수 기반 방법에서 관찰되는 탈락 문제를 크게 완화한다. Go-Explore와 같이 복잡한 다단계 훈련이 필요로 하지 않다.
  • NetHack에서 BeBold는 여러 작업에서 최신 기준 성능을 달성하며, 매우 복잡하고 프로시저적으로 생성된 환경에서 강력한 일반화 능력을 보여준다.
  • 내재 보상 메커니즘은 渐近적 일치성이 있다. 충분한 탐색이 이루어지면 역 방문 빈도가 사라지므로, 상태 차이 접근법에서 관찰되는 지속적인 보상 문제를 피할 수 있다.
  • 간단한 구조임에도 불구하고, Go-Explore나 RIDE와 같은 더 복잡한 방법들보다 뛰어난 성능을 보이며, 특히 장거리 탐색과 경계를 횡단하는 데 필요한 환경에서 뛰어난 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.