Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Meta Learning of Exploration

Ron Dorfman, Idan Shenfeld|arXiv (Cornell University)|2020. 08. 06.
Reinforcement Learning in Robotics참고 문헌 46인용 수 9
한 줄 요약

이 논문은 기존 강화학습 에이전트의 오프라인 데이터로부터 베이지안 최적 탐색 정책을 학습하는 오프라인 메타-RL 프레임워크인 BOReL을 제안한다. VariBAD를 오프폴리시 Q러닝으로 확장하고, 데이터 수집 및 리워드 재라벨링을 통해 MDP의 모호성을 해결함으로써, BOReL은 메타에이전트가 훈련 데이터에 포함되지 않은 새로운 탐색 전략—예를 들어 희박한 리워드 환경에서의 체계적 탐색—을 발견할 수 있도록 한다. 이는 온라인 톰슨 샘플링 기반선보다 성능이 뛰어나다.

ABSTRACT

Consider the following instance of the Offline Meta Reinforcement Learning (OMRL) problem: given the complete training logs of $N$ conventional RL agents, trained on $N$ different tasks, design a meta-agent that can quickly maximize reward in a new, unseen task from the same task distribution. In particular, while each conventional RL agent explored and exploited its own different task, the meta-agent must identify regularities in the data that lead to effective exploration/exploitation in the unseen task. Here, we take a Bayesian RL (BRL) view, and seek to learn a Bayes-optimal policy from the offline data. Building on the recent VariBAD BRL approach, we develop an off-policy BRL method that learns to plan an exploration strategy based on an adaptive neural belief estimate. However, learning to infer such a belief from offline data brings a new identifiability issue we term MDP ambiguity. We characterize the problem, and suggest resolutions via data collection and modification procedures. Finally, we evaluate our framework on a diverse set of domains, including difficult sparse reward tasks, and demonstrate learning of effective exploration behavior that is qualitatively different from the exploration used by any RL agent in the data.

연구 동기 및 목표

  • 기존 강화학습 에이전트의 사전 수집된 데이터로부터 효과적인 탐색 정책을 학습하는 오프라인 메타-RL 방법을 개발하는 것.
  • belief-증강 상태를 유지하면서 VariBAD 프레임워크를 오프폴리시 학습으로 확장하는 것.
  • 오프라인 데이터가 상태 전이가 희박하거나 겹치는 경우 환경의 구조를 식별하지 못함으로써 발생하는 MDP 모호성 문제를 정형화하고 해결하는 것.
  • 메타에이전트가 훈련 데이터에 포함된 어떤 에이전트보다도 질적으로 다른, 더 효과적인 탐색 행동을 학습할 수 있음을 보여주는 것.

제안 방법

  • 오프라인 트레이젝터리에서 신경망 기반 신뢰도 추정치를 학습하기 위해 변동형 오토인코더를 사용하여 VariBAD의 belief-증강 상태 표현을 오프폴리시 Q러닝에 적응시킴으로써, 온라인 상호작용 없이도 베이지안 RL을 가능하게 함.
  • 오프라인 트레이젝터리에서 추론된 신뢰도 추정치를 학습하기 위해 변동형 오토인코더를 사용함.
  • 사후 불확실성 하에서 탐색과 이용의 균형을 이루는 메타정책을 오프폴리시 Q러닝으로 훈련함.
  • 다양하고 겹치지 않는 식별 상태를 다양한 작업 간에 확보함으로써 MDP 식별 가능성 보장을 위한 데이터 수집 프로토콜을 제안함.
  • 재수집이 필요 없이 환경의 차이가 리워드의 차이일 뿐인 경우 MDP 모호성을 해결하기 위해 리워드 재라벨링 기법을 도입함.
  • 이러한 구성 요소들을 조합하여, 메타-RL을 위한 베이지안 오프라인 강화학습 프레임워크인 BOReL을 구성함.

실험 결과

연구 질문

  • RQ1메타에이전트는 온라인 상호작용 없이 기존 강화학습 에이전트의 오프라인 데이터로부터 효과적인 탐색 전략을 학습할 수 있는가?
  • RQ2메타-RL의 오프폴리시 설정에서 베이지안 RL을 어떻게 확장할 수 있으며, 이를 통해 베이지안 최적성을 유지할 수 있는가?
  • RQ3오프라인 메타-RL에서 MDP 모호성이 발생하는 원인은 무엇이며, 데이터 수집 또는 사전처리 단계에서 이를 어떻게 완화할 수 있는가?
  • RQ4환경의 차이가 리워드의 차이일 뿐인 경우 리워드 재라벨링이 MDP 모호성을 해결할 수 있는가?
  • RQ5제안된 방법은 훈련 데이터에 포함된 에이전트들과는 근본적으로 다른 탐색 행동을 학습하는가?

주요 결과

  • BOReL은 희박한 리워드 환경에서 미지의 목표를 체계적으로 탐색하는 베이지안 최적 탐색 정책을 학습한다. 예를 들어 반원형 환경에서 숨겨진 목표를 찾기 위해 반원을 따라 이동하는 전략을 취한다.
  • Ant-Semi-circle 도메인에서, 균일한 데이터 수집 조건 하에서 메타에이전트는 평균 수익 171.8 ± 7.0을 기록하며, 적절한 데이터 다양성이 확보되지 않은 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • 메타에이전트는 훈련 데이터의 에이전트들과 질적으로 다른 행동을 보인다: 첫 번째 에피소드에는 탐색을 하며, 두 번째 에피소드에는 이용을 함—이는 훈련 데이터에 포함된 어떤 에이전트와도 다른 행동 양태이다.
  • 정책 재생 없이도, 비겹치는 식별 상태를 가진 도메인에서는 성능이 급격히 떨어지며, 이는 MDP 모호성이 성능 저하의 핵심 원인임을 확인한다.
  • 리워드 재라벨링의 제거 실험에서는 잘못된 신뢰도 업데이트가 발생—에이전트가 첫 번째로 방문한 목표에 오랫동안 고정됨—을 통해 재라벨링 단계의 필수성을 입증한다.
  • 고정된 초기 위치를 가진 낮은 다양성 데이터셋에서도 BOReL은 비트리비얼한 탐색 행동을 학습함으로써, 데이터 품질 제한에 대해 뛰어난 내구성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.