Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Difference Uncertainties as a Signal for Exploration

Sebastian Flennerhag, Jane X. Wang|arXiv (Cornell University)|2020. 10. 05.
Reinforcement Learning in Robotics참고 문헌 52인용 수 7
한 줄 요약

이 논문은 시간차(TD) 오차에 대한 불확실성 추정을 통해 내재 탐색 신호를 생성하는 새로운 방법인 시간차 불확실성(TDU)을 제안한다. 관측된 상태-행동 전이에 기반한 불확실성 조건화를 통해 모델 불확실성과 환경 노이즈를 분리함으로써, 고불확실성 상태를 목표로 하는 별도의 탐색 정책을 가능하게 하여 몬테주마의 복수, 딥시아와 같은 도전적인 탐색 과제에서 더 높은 데이터 효율성과 성능 향상을 이룬다.

ABSTRACT

An effective approach to exploration in reinforcement learning is to rely on an agent's uncertainty over the optimal policy, which can yield near-optimal exploration strategies in tabular settings. However, in non-tabular settings that involve function approximators, obtaining accurate uncertainty estimates is almost as challenging a problem. In this paper, we highlight that value estimates are easily biased and temporally inconsistent. In light of this, we propose a novel method for estimating uncertainty over the value function that relies on inducing a distribution over temporal difference errors. This exploration signal controls for state-action transitions so as to isolate uncertainty in value that is due to uncertainty over the agent's parameters. Because our measure of uncertainty conditions on state-action transitions, we cannot act on this measure directly. Instead, we incorporate it as an intrinsic reward and treat exploration as a separate learning problem, induced by the agent's temporal difference uncertainties. We introduce a distinct exploration policy that learns to collect data with high estimated uncertainty, which gives rise to a curriculum that smoothly changes throughout learning and vanishes in the limit of perfect value estimates. We evaluate our method on hard exploration tasks, including Deep Sea and Atari 2600 environments and find that our proposed form of exploration facilitates both diverse and deep exploration.

연구 동기 및 목표

  • 함수 근사기를 사용하는 비표본 강화학습에서 가치 함수에 대한 신뢰할 수 있는 불확실성 추정 문제를 해결하기 위해.
  • 미관측 향후 상태 방문으로 인한 가치 함수 불확실성 추정의 편향을 줄이기 위해.
  • 환경 불확실성에서 모델 불확실성을 분리하는 확장 가능한 탐색 신호를 개발하기 위해.
  • 불확실성 기반 내재 보상에 기반한 별도의 정책을 통해 효율적인 탐색을 가능하게 하기 위해.
  • 하드 탐색 Atari 환경과 딥시아에서 더 높은 데이터 효율성과 최종 성능 향상을 입증하기 위해.

제안 방법

  • TDU는 가치 함수 그 자체에 대한 불확실성 추정이 아니라 시간차(TD) 오차에 대한 불확실성 추정을 수행함으로써, 향후 상태 방문 불확실성으로 인한 편향을 감소시킨다.
  • 관측된 상태-행동 전이에 기반한 불확실성 추정을 조건화하여 환경의 변동성을 제어하고 모델 불확실성을 분리한다.
  • 이러한 TD 불확실성에서 유도된 내재 보상을 최대화하도록 별도의 탐색 정책을 훈련시어 탐색을 정책 최적화에서 분리한다.
  • 가치 최적화 정책과 탐색 정책 간에 공유된 리PLAY 버퍼를 사용하여 부트스트랩 불확실성 추정을 가능하게 한다.
  • 내재 보상은 탐색 강도를 제어할 수 있는 보너스 초모수 β에 의해 스케일링되며, 환경별로 조정 가능하다.
  • TDU는 부트스트랩 DQN을 사용한 이중 정책 설정에서 평가되었으며, 탐색자( exploiter )는 최적 정책을 학습하고 탐색자( explorer )는 불확실성 기반 내재 보상에 기반해 데이터를 수집한다.

실험 결과

연구 질문

  • RQ1직접적인 가치 함수 불확실성보다 시간차 오차에 대한 불확실성 추정이 탐색에 더 신뢰할 수 있고 편향이 적은 신호를 제공할 수 있는가?
  • RQ2관측된 상태-행동 전이에 기반한 불확실성 조건화가 함수 근사 설정에서 편향을 줄이고 탐색 효율성을 향상시키는가?
  • RQ3불확실성 기반 내재 보상에 기반한 별도의 탐색 정책이 표준 탐색 방법보다 더 높은 데이터 효율성과 최종 성능을 달성할 수 있는가?
  • RQ4탐색 보너스 강도(β)가 하드 탐색 및 밀도 보상 게임을 포함한 다양한 환경에서 성능에 어떤 영향을 미치는가?
  • RQ5선수 함수를 통합할 경우 TDU 프레임워크에서 성능 향상은 어느 정도 이루어지는가?

주요 결과

  • TDU는 몬테주마의 복수, 프라이빗 아이, 벤처, 그라비타르와 같은 하드 탐색 게임에서 최종 평균 점수와 데이터 효율성에서 통계적으로 유의미한 향상을 달성했다.
  • 몬테주마의 복수에서 선수 함수 없이도 TDU는 베이스라인보다 통계적으로 유의미한 향상을 보였으며, 더 높은 최종 성능과 더 빠른 수렴을 보였다.
  • 전체 Atari 57게임 세트에서 탐색 보너스 강도를 줄이면(λ=0.1) 인간 정규화 점수(HNS)가 향상되었고, 탐색 중심 게임에서 성능 저하 없이 유지되었다.
  • 선수 함수를 통합한 TDU는 몬테주마의 복수, 프라이빗 아이, 그라비타르에서 통계적으로 유의미한 성능 향상을 달성하여, 특히 도전적인 환경에서 선수 함수가 성능 향상에 기여함을 시사했다.
  • 밀도 보상 게임과 탐색 중심 게임 모두에서 모든 베이스라인보다 우월하거나 동등한 성능을 보였으며, 시즈퀘스트와 테니스와 같은 게임에서 평균 HNS 향상과 더 빠른 수렴을 보였다.
  • 제거 실험 결과, 탐색 보너스 강도(β)가 성능에 상당한 영향을 미치며, 특히 밀도 보상 환경에서 최적의 조정이 최대 성과를 이끌어내는 데 필요함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.