Skip to main content
QUICK REVIEW

[논문 리뷰] Model-Invariant State Abstractions for Model-Based Reinforcement Learning

Manan Tomar, Amy Zhang|arXiv (Cornell University)|2021. 02. 19.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

이 논문은 모델기반 강화학습(MBRL)에서 역학의 인과적 희박성(causal sparsity)을 활용하여 일반화를 향상시키는 모델-불변 상태 추상화를 제안한다. 각 상태 변수의 인과적 부모들만 기반으로 표현을 학습함으로써, 새로운 상태-행동 조합에 대해 조합적 일반화를 가능하게 하여 MuJoCo의 Humanoid와 같은 복잡한 제어 과제에서 뛰어난 샘플 효율성과 모델 정확도를 달성한다.

ABSTRACT

Accuracy and generalization of dynamics models is key to the success of model-based reinforcement learning (MBRL). As the complexity of tasks increases, so does the sample inefficiency of learning accurate dynamics models. However, many complex tasks also exhibit sparsity in the dynamics, i.e., actions have only a local effect on the system dynamics. In this paper, we exploit this property with a causal invariance perspective in the single-task setting, introducing a new type of state abstraction called \ extit{model-invariance}. Unlike previous forms of state abstractions, a model-invariance state abstraction leverages causal sparsity over state variables. This allows for compositional generalization to unseen states, something that non-factored forms of state abstractions cannot do. We prove that an optimal policy can be learned over this model-invariance state abstraction and show improved generalization in a simple toy domain. Next, we propose a practical method to approximately learn a model-invariant representation for complex domains and validate our approach by showing improved modelling performance over standard maximum likelihood approaches on challenging tasks, such as the MuJoCo-based Humanoid. Finally, within the MBRL setting we show strong performance gains with respect to sample efficiency across a host of other continuous control tasks.

연구 동기 및 목표

  • 분포 이탈(distributional shift) 상황에서 모델기반 강화학습(MBRL)의 동역학 모델 일반화 능력 부족 문제를 해결하기 위해.
  • 각 상태 변수가 이전 변수의 소수의 부분집합에만 의존하는 상태 역학의 희박성을 인도적 편향(inductive bias)으로 활용하여 일반화 능력을 향상시키기 위해.
  • 모델-불변성(model-invariance)이라는 새로운 유형의 상태 추상화를 정의하여, 각 상태 변수의 인과적 부모들에만 초점을 맞춰 간섭에 대해 불변성을 보장하기 위해.
  • 함수 근사 기법을 사용하여 복잡한 도메인에서 모델-불변 표현을 학습할 수 있는 실용적인 방법을 개발하기 위해.
  • 모델-불변 추상화를 사용할 경우 MBRL에서 샘플 효율성과 모델 정확도가 향상됨을 입증하기 위해.

제안 방법

  • 모델-불변성을 각 상태 변수의 인과적 부모들만 포함하는 상태 추상화로 정의하여, 간섭에 대해 불변성을 보장한다.
  • 인과적 불변성 원리를 활용해 다양한 간섭 상황에서 다음 상태 변수를 일관되게 예측할 수 있는 특징를 식별한다.
  • 다음 상태 변수의 불변이고 인과적인 예측자들에만 의존하도록 하는 표현 학습 목표를 구성한다.
  • 명시적인 그래프 구조 학습이 필요 없이, 희박성 유도 불변성 목표를 갖는 신경망을 사용하여 모델-불변 표현을 근사한다.
  • 학습된 불변 모델을 SAC와 같은 MBRL 파ip라인에 통합하여 계획 및 정책 최적화를 가능하게 한다.
  • 불변 표현을 사용하여 최대우도법(maximum likelihood)으로 모델을 훈련함으로써, 훈련 중에 관측되지 않은 상태-행동 분포로의 일반화를 보장한다.

실험 결과

연구 질문

  • RQ1모델-불변 상태 추상화를 통해 동역학의 인과적 희박성을 활용하면 MBRL에서 일반화 능력이 향상되는가?
  • RQ2각 상태 변수의 인과적 부모들만 기반으로 하는 표현이 탐색 가정 하에 최적의 정책 학습을 달성하는 데 충분한가?
  • RQ3MuJoCo와 같은 고차원적이고 복잡한 환경에서 모델-불변 표현을 학습할 수 있는 실용적인 방법을 설계할 수 있는가?
  • RQ4모델-불변 추상화를 사용할 경우 기존의 표준 MBRL 접근법에 비해 샘플 효율성과 모델 정확도에서 측정 가능한 향상이 이루어지는가?
  • RQ5모델-불변성은 훈련 중에 관측되지 않은 상태 변수 조합에 대해 어떻게 일반화되는가?

주요 결과

  • 이론적 분석을 통해 탐색 가정 하에서 최적의 정책 학습을 위해 인과적 부모들에 기반한 모델-불변 표현이 최적임을 밝혀냈다.
  • 간단한 토이 도메인에서, 모델-불변 접근법은 비요약 추상화보다 훈련 중에 관측되지 않은 상태 분포로의 일반화 능력이 뛰어나다.
  • MuJoCo 기반의 Humanoid 환경에서, 모델-불변 학습자는 표준 최대우도법 기반 베이스라인에 비해 유의미하게 더 뛰어난 모델 일반화 성능을 보였다.
  • SAC와 통합했을 때, 모델-불변 접근법은 여러 연속 제어 과제에서 샘플 효율성 향상이 두드러진 성능 향상을 보였다.
  • 계획 수평이 길어질수록 불변 학습자와 표준 학습자 간의 성능 격차가 커지며, 이는 장기 계획에서의 일반화 능력 향상을 시사한다.
  • 이 방법은 조합적으로 일반화되며, 훈련 중에 관측되지 않은 상태 변수 값 조합에 대해서도 정확한 예측이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.