Skip to main content
QUICK REVIEW

[논문 리뷰] Causal Dynamics Learning for Task-Independent State Abstraction

Zizhao Wang, Xuesu Xiao|arXiv (Cornell University)|2022. 06. 27.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 조건부 통일성 테스트를 통해 상태 변수와 행동 간의 유사한 종속성을 식별하고 제거함으로써 인과적 동역학 모델을 학습하는 Causal Dynamics Learning (CDL)을 제안한다. 이 방법은 작업에 종속되지 않는 상태 추상화를 가능하게 하여 모델 기반 강화 학습에서 일반화 능력과 샘플 효율성을 향상시키며, 시뮬레이션 환경에서 미사용된 상태와 후속 작업에서 밀도 모델을 능가한다.

ABSTRACT

Learning dynamics models accurately is an important goal for Model-Based Reinforcement Learning (MBRL), but most MBRL methods learn a dense dynamics model which is vulnerable to spurious correlations and therefore generalizes poorly to unseen states. In this paper, we introduce Causal Dynamics Learning for Task-Independent State Abstraction (CDL), which first learns a theoretically proved causal dynamics model that removes unnecessary dependencies between state variables and the action, thus generalizing well to unseen states. A state abstraction can then be derived from the learned dynamics, which not only improves sample efficiency but also applies to a wider range of tasks than existing state abstraction methods. Evaluated on two simulated environments and downstream tasks, both the dynamics model and policies learned by the proposed method generalize well to unseen states and the derived state abstraction improves sample efficiency compared to learning without it.

연구 동기 및 목표

  • 밀도 높은 동역학 모델에서 발생하는 유사 상관관계로 인한 모델 기반 RL의 일반화 능력 저하 문제를 해결하기 위해.
  • 상태 변수와 행동 간에 필요한 종속성만 식별하는 인과적 동역학 모델을 개발하기 위해.
  • 인과 모델에서 유도된 작업에 종속되지 않는 상태 추상화를 통해 다양한 작업 간의 샘플 효율성과 일반화 능력을 향상시키기 위해.
  • 미래 작업에 유용한 제어 가능한 변수를 생략하는 보상 기반 추상화(예: bisimulation)의 한계를 극복하기 위해.

제안 방법

  • 이 방법은 조건부 통일성 테스트를 사용하여 동역학 모델 내 상태 변수와 행동 간의 유사 종속성을 식별하고 제거한다.
  • 새로운 신경망 아키텍처가 동역학 모델의 엔드 투 엔드 학습 중 조건부 상호정보를 추정한다.
  • 인과 모델은 인과적 영향에 따라 상태 변수를 제어 가능한, 행동과 관련된, 행동과 관련이 없는 변수로 분할한다.
  • 유도된 상태 추상화는 행동과 관련이 없는 변수(예: 시계)를 생략하면서 계획에 필요한 동역학을 유지한다.
  • 이 방법은 분포 외 상태로의 일반화가 더 잘 되는 희소하고 인과적으로 정확한 모델을 사용한 계획을 가능하게 한다.
  • 다양한 탐색 정책(예: PredDiff, Uniform, Curiosity)이 수집한 데이터를 사용하여 정확도에 대한 내구성을 평가한다.

실험 결과

연구 질문

  • RQ1오프라인 데이터에서 유사 상관관계를 제거함으로써, 복잡한 환경에서 미사용된 상태로의 일반화 능력이 뛰어난 인과적 동역학 모델을 학습할 수 있는가?
  • RQ2인과적 구조 탐색은 밀도 모델 대비 후속 RL 작업에서 샘플 효율성을 어떻게 향상시키는가?
  • RQ3순수하게 동역학에서 유도된 상태 추상화는 작업에 종속되지 않으면서도 다양한 작업 간의 일반화를 지원할 수 있는가?
  • RQ4다양한 탐색 전략은 학습된 인과 그래프의 품질과 후속 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • CDL는 복잡한 환경에서 미사용된 상태에서 거의 완벽한 일반화를 달성했으며, 예측 정확도가 본 적 있는 상태와 동일한 성능을 보였고, 밀도 모델은 복잡한 환경에서 60–90%의 정확도 하락을 겪었다.
  • 유사 상관관계가 있는 탐색 전략(예: 호기심 기반)으로 수집된 데이터에서도 인과 모델은 정확한 인과 그래프를 학습했지만, 지연 행동으로 인해 재현율은 낮았다.
  • 유도된 인과 상태 추상화를 사용해 훈련된 정책은 모든 후속 작업에서 밀도 모델을 사용한 정책보다 더 높은 샘플 효율성과 더 나은 일반화 능력을 보였다.
  • 상태 추상화는 행동과 관련이 없는 변수(예: 시계)를 성공적으로 생략하면서도 제어 가능한 변수와 행동과 관련된 변수를 유지하여, 보상 기반 추상화보다 더 넓은 작업 적용 범위를 확보했다.
  • 화학 및 조작 환경에서 최신 기술의 밀도 모델보다도 성능이 뛰어나 일반화 능력과 샘플 효율성에서 일관된 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.