Skip to main content
QUICK REVIEW

[논문 리뷰] InfoBot: Transfer and Exploration via the Information Bottleneck

Anirudh Goyal, Riashat Islam|arXiv (Cornell University)|2019. 01. 30.
Reinforcement Learning in Robotics참고 문헌 43인용 수 46
한 줄 요약

InfoBot은 목표 조건부 정책을 정보 병목으로 규제하여 의사 결정 상태를 발견하게 하며, 새로운 작업으로의 전이가 더 잘 일어나고 일반화 가능한 탐색 보너스를 제공하여 표준 탐색 방법보다 더 뛰어납니다.

ABSTRACT

A central challenge in reinforcement learning is discovering effective policies for tasks where rewards are sparsely distributed. We postulate that in the absence of useful reward signals, an effective exploration strategy should seek out {\it decision states}. These states lie at critical junctions in the state space from where the agent can transition to new, potentially unexplored regions. We propose to learn about decision states from prior experience. By training a goal-conditioned policy with an information bottleneck, we can identify decision states by examining where the model actually leverages the goal state. We find that this simple mechanism effectively identifies decision states, even in partially observed settings. In effect, the model learns the sensory cues that correlate with potential subgoals. In new environments, this model can then identify novel subgoals for further exploration, guiding the agent through a sequence of potential decision states and through new regions of the state space.

연구 동기 및 목표

  • 다목표 강화학습에서 개별 목표에 대한 의존성을 줄여 작업 구조 학습을 장려합니다.
  • 목표 의사결정이 필요한 의사 결정 상태를 식별합니다.
  • 새로운 환경에서 전이 친화적 탐색 보너스를 제공하기 위해 학습된 의사 결정 상태를 활용합니다.
  • 다양하고 보상이 희박한 작업에서도 일반화와 효율적 탐색을 촉진합니다.

제안 방법

  • 목표 정보를 규제하는 정보 병목 규칙자와 함께 하는 목표 조건부 정책: I(A;G|S)에 의해 목표에 대한 의존성을 벌점화하며 기대 보상을 최대화합니다.
  • 인코더 p_enc(Z|S,G)와 디코더 p_dec(A|S,Z)로 정책 분해를 수행하여 πθ(A|S,G)를 근사합니다.
  • 고전적 주변합산을 피하기 위한 q(Z|S)와 함께 변분 한계를 사용하여 tractable한 목적식을 포함하는 KL[p_enc(Z|S,G)||q(Z|S)]를 얻습니다.
  • 수정된 보상 r̃t = rt + β KL[p_enc(Z|st,gt)||q(Z|st)]를 사용하는 on-policy 정책 그래디언트 업데이트(REINFORCE).
  • train task에서 학습 후 인코더를 동결하고, 새로운 정책을 train task의 KL[p_enc(Z|S,G)||q(Z|S)]를 탐색 보너스로 사용하되, 과도한 탐색을 억제하기 위한 카운트 기반 항으로 조절합니다.
  • Optional: 학습 과제의 인코더를 활용해 보지 않은 관련 작업에서 탐색을 유도하는 transfer를 시연합니다.

실험 결과

연구 질문

  • RQ1정보 병목으로 인한 목표 조건부 정책이 관련되지만 보지 못한 작업으로의 정책 전송을 향상시킬 수 있는가?
  • RQ2의사 결정 상태를 활용한 탐색 보너스가 새로운 환경에서 효과적이고 과제가 맞춤형으로 맞춰질 수 있는가?
  • RQ3목표 정보의 규제가 부분 관측성 하에서 다목표 RL의 일반화를 촉진하는가?
  • RQ4InfoBot의 전이 가능한 탐색은 카운트 기반, VIME, 호기심 기반 탐색 방법과 비교해 어떤 차이가 있는가?

주요 결과

  • 목표 병목화된 정책은 MiniGrid 과제에서 일반적으로 vanilla 목표 조건부 baselines보다 일반화가 더 잘됩니다.
  • InfoBot은 표준 RL 접근 방식보다 더 크거나 더 복잡한 환경(MultiRoom, FindObj 과제 등)으로의 전이 성능이 더 높습니다.
  • 의사 결정 상태를 탐색 보너스로 사용하는 것은 전이 설정에서 높은 성공률을 유지하며, 과제가 복잡해질수록 카운트 기반, VIME, 호기심 주도 방법보다 우수합니다.
  • 목표 기반 MiniPacMan에서 InfoBot은 6x6에서 학습한 후 11x11 미로에서 64%의 성공률을 달성하며 여러 baselines를 상회합니다.
  • 과제 전반에 걸쳐 InfoBot 컨트롤러는 일반화되는 습관을 학습하는 반면, 탐색을 위한 의사 결정 상태의 편차가 과제별 적응을 포착합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.