Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Discrete State Abstractions With Deep Variational Inference

Ondřej Bíža, Robert W. Platt|arXiv (Cornell University)|2020. 03. 09.
Reinforcement Learning in Robotics참고 문헌 25인용 수 6
한 줄 요약

이 논문은 고차원 이미지 상태를 연속적 임bedding으로 매핑한 후, 행동 조건부 은닉 마르코프 모델(HMM)을 통해 클러스터링함으로써, 깊이 있는 변동형 추론 방법을 제안한다. 이 방법은 근사 MDP 비유사성으로서 이산 상태 추상화를 학습한다. 주요 기여는 다중 목표 강화 학습 환경에서 추가 학습 없이도 새로운 목표에 대해 효율적인 계획 수립이 가능한 엔드 투 엔드로 훈련 가능한 프레임워크를 제공한다는 점이다.

ABSTRACT

Abstraction is crucial for effective sequential decision making in domains with large state spaces. In this work, we propose an information bottleneck method for learning approximate bisimulations, a type of state abstraction. We use a deep neural encoder to map states onto continuous embeddings. We map these embeddings onto a discrete representation using an action-conditioned hidden Markov model, which is trained end-to-end with the neural network. Our method is suited for environments with high-dimensional states and learns from a stream of experience collected by an agent acting in a Markov decision process. Through this learned discrete abstract model, we can efficiently plan for unseen goals in a multi-goal Reinforcement Learning setting. We test our method in simplified robotic manipulation domains with image states. We also compare it against previous model-based approaches to finding bisimulations in discrete grid-world-like environments. Source code is available at https://github.com/ondrejba/discrete_abstractions.

연구 동기 및 목표

  • 딥 강화 학습에서 흔히 나타나는 고차원 상태 공간에서 압축되고 이산적인 상태 추상화를 학습하는 데 도전한다.
  • 재학습 없이도 다중 목표 강화 학습 환경에서 훈련 중에 보지 못한 목표에 대해 효율적인 계획을 수행할 수 있도록 한다.
  • 전이 및 보상 구조를 유지하는 추상 MDP를 학습하여 원래 MDP의 근사 비유사성을 형성한다.
  • 이전 방법들이 새로운 작업에 일반화되지 않거나 이산적이고 평면적인 MDP의 구조를 생성하지 못하는 한계를 극복한다.
  • 예측 및 구조적 제약 조건을 갖춘 표현 학습을 위한 변동형 정보 버블킷 프레임워크에 구조적 사전 지식(GMM 및 HMM)을 통합한다.

제안 방법

  • 깊이 신경망 인코더가 고차원 이미지 상태를 결정에 관련된 정보를 유지하는 연속적 임베딩으로 매핑한다.
  • 연속적 임베딩은 학습된 행동 조건부 은닉 마르코프 모델(HMM)을 통해 이산적인 추상 상태로 매핑되며, 이는 시간적 전이 동역학을 모델링한다.
  • 이 방법은 추상 상태로부터 Q-값 예측을 최대화하면서 인코딩 복잡성을 최소화하는 변동형 정보 버블킷(VIB) 목적함수를 사용한다.
  • 구조적 사전 지식(GMM 및 HMM)은 신경 인코더와 함께 엔드 투 엔드로 훈련되며, 클러스터 중심, 공분산 및 전이 행렬이 추상 MDP를 구성한다.
  • HMM 사전 지식은 행동별 전이 동역학을 인코딩하여 추상 모델이 이산 상태와 전이 확률을 갖는 유효한 MDP를 표현할 수 있도록 한다.
  • 사전 지식의 학습된 파라미터(예: 클러스터 중심 및 전이 행렬)가 추출되어 계획을 위한 이산 추상 MDP를 형성한다.

실험 결과

연구 질문

  • RQ1딥 변동형 추론 프레임워크는 고차원 이미지 기반 환경에서 근사 MDP 비유사성을 형성하는 이산 상태 추상화를 학습할 수 있는가?
  • RQ2학습 중에 보지 못한 목표에 대해 학습된 추상 MDP가 추가 학습 없이도 효율적인 계획을 지원할 수 있는가?
  • RQ3행동 조건부 HMM 사전 지식의 사용이 GMM와 같은 단순한 사전 지식보다 추상화의 품질과 구조를 어떻게 향상시키는가?
  • RQ4이 방법은 장기 환경에서의 작업에 일반화되며 분포 이탈 상황에서도 성능을 유지하는가?
  • RQ5추상화가 재학습 없이 정책 압축과 전이를 가능하게 하는가?

주요 결과

  • 이 방법은 고차원 이미지 기반 환경에서 최대 1000개의 추상 상태를 포함하는 고품질의 근사 비유사성으로서의 이산 추상화를 성공적으로 학습한다.
  • 학습된 추상 MDP는 추가 학습이나 미세조정 없이도 다중 목표 강화 학습 환경에서 새로운 목표에 대해 효율적인 계획을 수행할 수 있다.
  • 이미지 상태를 갖는 단순화된 로봇 조작 도메인에서의 실험 결과, 추상 모델이 결정에 관련된 정보를 유지하면서도 상태 공간의 복잡성을 감소시킨다.
  • 특히 새로운 작업에 대한 일반화 성능에서 이전의 모델 기반 접근법보다 뛰어나며, 이산 격자 월드 유사 환경에서 비유사성 학습을 수행한다.
  • 행동 조건부 HMM 사전 지식의 사용은 GMM 기반 대안 대비 더 구조적이고 역학적으로 일관된 추상 MDP를 생성한다.
  • 이 프레임워크는 깊이 Q-네트워크 정책의 압축을 가능하게 하며, 성능을 유지하면서도 저차원 이산 표현을 학습한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.