Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Reinforcement Learning with Causal Structured World Models

Zhengmao Zhu, Xionghui Chen|arXiv (Cornell University)|2022. 06. 03.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

이 논문은 일반화 성능 향상을 위해 인과적 구조 세계 모델을 통합한 모델 기반 오프라인 강화학습 알고리즘인 FOCUS를 제안한다. 시간적 제약 조건과 커널 기반의 통합 테스트를 적용한 수정된 PC 알고리즘을 통해 인과 발견을 수행함으로써, FOCUS는 오프라인 RL 벤치마크에서 기준 방법들보다 뛰어난 성능을 보이며, 정확한 인과 구조 학습을 통해 우수한 내구성과 샘플 효율성을 확보한다.

ABSTRACT

Model-based methods have recently shown promising for offline reinforcement learning (RL), aiming to learn good policies from historical data without interacting with the environment. Previous model-based offline RL methods learn fully connected nets as world-models that map the states and actions to the next-step states. However, it is sensible that a world-model should adhere to the underlying causal effect such that it will support learning an effective policy generalizing well in unseen states. In this paper, We first provide theoretical results that causal world-models can outperform plain world-models for offline RL by incorporating the causal structure into the generalization error bound. We then propose a practical algorithm, oFfline mOdel-based reinforcement learning with CaUsal Structure (FOCUS), to illustrate the feasibility of learning and leveraging causal structure in offline RL. Experimental results on two benchmarks show that FOCUS reconstructs the underlying causal structure accurately and robustly. Consequently, it performs better than the plain model-based offline RL algorithms and other causal model-based RL algorithms.

연구 동기 및 목표

  • 오프라인 강화학습에서 인과적 세계 모델이 일반 세계 모델보다 우월한 이론적 근거를 제시하는 것.
  • 정책 학습 향상을 위해 오프라인 데이터로부터 인과적 구조를 학습하고 활용하는 실용적 알고리즘 FOCUS를 개발하는 것.
  • 연속 변수와 시간적 의존성을 포함하는 강화학습 데이터에 인과 발견 방법을 적용하는 데 도전하는 것.
  • 오프라인 데이터셋에서의 임의의 상관관계를 줄이기 위해 인과적 세계 모델이 일반화 오차를 감소시킨다는 것을 입증하는 것.
  • 오프라인 RL 벤치마크에서 경험적으로 방법을 검증하여 성능 향상과 내구성 향상을 입증하는 것.

제안 방법

  • 미래가 과거를 유도할 수 없음을 반영한 시간적 제약 조건을 PC 알고리즘에 통합하여 조건부 통합 테스트 수를 줄이고 인과 방향 식별을 가능하게 한다.
  • 파라미터 형태를 가정하지 않는 연속 변수 간의 관계 탐지에 커널 기반 조건부 통합 테스트(KCI)를 활용한다.
  • 인과 발견에서 조건부 집합을 선택하는 원칙적인 방법을 도입하여 구조 학습의 정확도와 내구성을 향상시킨다.
  • 학습된 구조에서 인과 세계 모델을 구성하여 오프라인 MBRL에서 정책 학습을 이끌어낸다.
  • 인과 세계 모델을 사용해 상태 전이를 예측하고 정책을 평가함으로써, 잘못된 상관관계에서 발생하는 오차를 최소화한다.
  • 모델을 오프라인 RL 작업에 적용하여, 인과 세계 모델을 사용해 정책을 훈련하면서도 미리 보지 않은 상태로의 일반화를 보장한다.

실험 결과

연구 질문

  • RQ1인과적 구조를 세계 모델에 통합하면 오프라인 강화학습에서 일반화 오차 경계를 줄일 수 있는가?
  • RQ2시간적 의존성과 연속 변수를 고려할 때, 인과 발견은 오프라인 RL 데이터의 제약 조건에 어떻게 적응할 수 있는가?
  • RQ3비인과 모델에 비해 인과적 세계 모델은 오프라인 강화학습에서 더 나은 정책 성능과 일반화를 이끌어내는가?
  • RQ4기준 방법들에 비해 FOCUS는 데이터 다양성에 얼마나 덜 의존하는가?
  • RQ5인과 구조 학습의 정확도와 내구성이 후속 정책 성능에 어떤 영향을 미치는가?

주요 결과

  • FOCUS는 자동차 주행 및 MuJoCo(Inverted Pendulum) 벤치마크에서 기준 방법들보다 유의미하게 높은 정책 수익을 달성했으며, 일부 설정에서 최대 40%의 성과 향상을 보였다.
  • 랜덤 데이터셋에서는 FOCUS가 MOPO와 LNCM보다 각각 58.2점, 58.2점 높은 정책 수익을 기록했으며, 이는 정확한 인과 구조 학습 덕분이었다.
  • 데이터 다양성이 높고 임의의 상관관계가 약한 메디엄 리플레이 데이터셋에서는 FOCUS가 성능 향상이 가장 작았으며, 이는 인과 모델이 데이터 다양성에 덜 의존한다는 이론을 뒷받침한다.
  • 혼합 데이터셋에서 메디엄 리플레이 데이터 비율이 낮아져도 FOCUS는 뛰어난 성능을 유지하여, 더 나은 일반화 능력과 데이터 다양성에 대한 의존도 감소를 입증한다.
  • 제거 실험 결과, KCI 테스트와 조건부 변수 선택 메커니즘이 모두 인과 구조 학습의 정확도와 내구성 향상에 기여하는 것으로 확인되었다.
  • LNCM는 근접한 50% 확률 예측로 인해 낮은 분산을 보였지만 의미 없는 내구성을 보였으며, 이는 FOCUS의 뛰어난 구조 학습 품질을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.