Skip to main content
QUICK REVIEW

[논문 리뷰] Directed Exploration for Reinforcement Learning

Zhaohan Daniel Guo, Emma Brunskill|arXiv (Cornell University)|2019. 06. 18.
Reinforcement Learning in Robotics참고 문헌 18인용 수 9
한 줄 요약

이 논문은 강화학습에서 보상 보너스 방법의 비정적 불안정성 문제를 피하기 위해, 높은 불확실성 상태를 직접 햖갈 목표로 삼는 목표 조건화 정책을 훈련시켜 유도적 탐색을 제안한다. 이 방법은 FetchPush 및 마운틴 카와 같은 희박한 보상 환경에서 보상 보너스 기반 탐색보다 더 효율적이고 견고한 탐색을 달성한다.

ABSTRACT

Efficient exploration is necessary to achieve good sample efficiency for reinforcement learning in general. From small, tabular settings such as gridworlds to large, continuous and sparse reward settings such as robotic object manipulation tasks, exploration through adding an uncertainty bonus to the reward function has been shown to be effective when the uncertainty is able to accurately drive exploration towards promising states. However reward bonuses can still be inefficient since they are non-stationary, which means that we must wait for function approximators to catch up and converge again when uncertainties change. We propose the idea of directed exploration, that is learning a goal-conditioned policy where goals are simply other states, and using that to directly try to reach states with large uncertainty. The goal-conditioned policy is independent of uncertainty and is thus stationary. We show in our experiments how directed exploration is more efficient at exploration and more robust to how the uncertainty is computed than adding bonuses to rewards.

연구 동기 및 목표

  • 비정적 불확실성 업데이트로 인해 보상 보너스 기반 탐색의 비효율성을 해결한다.
  • 함수 근사기가 변화하는 불확실성 보너스를 따라가지 못해 발생하는 느린 수렴과 불안정성을 완화한다.
  • 불확실성 추정과 정책 학습을 분리하여 정적이고 목표 중심의 탐색 전략을 개발한다.
  • 로봇 조작 작업과 격자 환경과 같은 희박한 보상 환경에서 탐색 효율성과 견고성을 향상시킨다.
  • 불확실성 기반 목표 선택이 랜덤 목표 샘플링과 보상 보너스 방법에 비해 탐색 속도와 효과성 면에서 뛰어나다는 것을 입증한다.

제안 방법

  • 모든 특정 목표 상태 $g$ 에 도달하기 위해 상태-행동 쌍에서 행동으로 매핑하는 목표 조건화 정책 $\pi(s,g)$ 를 훈련시킨다.
  • 역동성 모델의 예측 손실로 계산된 불확실성 추정치를 사용해 높은 불확실성 상태를 목표 목표로 식별한다.
  • 불확실성 기반으로 목표 상태를 선택한 후, 사전 훈련된 목표 조건화 정책을 사용해 이를 직접 향해 도달하려 한다.
  • 목표 조건화 정책과 불확실성 계산을 분리하여, 변화하는 불확실성에도 불구하고 정책이 정적임을 보장한다.
  • 수집된 트레이젝터리를 공유 리PLAY 버퍼에 통합함으로써 기존의 오프-폴리시 강화학습 알고리즘과 유도적 탐색 컴포넌트를 통합한다.
  • SAC나 DQN과 같은 오프-폴리시 알고리즘을 주 학습 목표로 사용하고, 목표 조건화 정책은 정보성 상태로의 탐색을 이끈다.

실험 결과

연구 질문

  • RQ1정적이고 목표 조건화 정책이 비정적 보상 보너스 방법보다 탐색 효율성 면에서 뛰어나게 되는가?
  • RQ2불확실성 추정치가 노이즈가 있거나 정확하지 않을 경우, 보상 보너스 방법과 비교해 유도적 탐색은 어떻게 성능을 내는가?
  • RQ3복잡한 환경에서 불확실성 기반 목표 선택은 랜덤 목표 샘플링에 비해 탐색을 어떻게 향상시키는가?
  • RQ4목표 조건화 정책의 학습 속도가 유도적 탐색의 전체 탐색 효율성에 어떤 영향을 미치는가?
  • RQ5기존의 오프-폴리시 강화학습 알고리즘에 아키텍처 변경 없이 모odu로 통합 가능한가?

주요 결과

  • Mountain Car와 FetchPush 환경 모두에서, 불확실성 기반 목표 선택을 사용한 유도적 탐색은 랜덤 목표 샘플링에 비해 뚜렷이 뛰어난 성능을 보였다.
  • Mountain Car에서는 도메인의 단순성 덕분에 목표 조건화 정책이 빨리 학습되었음에도 불구하고, 유도적 탐색이 보상 보너스 방법보다 더 빠른 탐색을 달성했다.
  • FetchPush에서는 정책 학습이 느렸음에도 불구하고, 유도적 탐색은 보상 보너스 방법을 능가했으며, 노이즈가 있거나 지연된 불확실성 신호에 대해 뛰어난 견고성을 보였다.
  • 보상 보너스 방법은 비정적 성격으로 인해 불확실성 변화에 적응하는 데 더 오래 걸려, 함수 근사기를 통해 불확실성 신호가 지연되어 전파되었다.
  • 유도적 탐색에서 목표 조건화 정책는 불확실성 추정치의 변동에도 불구하고 안정적이고 효과적으로 유지되었으며, 보상 보너스 방법은 불안정성을 겪었다.
  • 유도적 탐색은 정확하지 않은 불확실성 측정치에 대해서도 더 뛰어난 견고성을 보였으며, 이는 보상 보너스 기법보다 불확실성 추정의 품질에 덜 민감하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.