Skip to main content
QUICK REVIEW

[논문 리뷰] Causally Correct Partial Models for Reinforcement Learning

Danilo Jimenez Rezende, Ivo Danihelka|arXiv (Cornell University)|2020. 02. 07.
Reinforcement Learning in Robotics참고 문헌 45인용 수 16
한 줄 요약

이 논문은 부분 모델에서의 혼동 요인 문제를 잠재 배경 변수를 통합함으로써 인과적으로 정확한 부분 모델(CPM)을 제안한다. 이는 관측이 완전히 이루어지지 않은 상황에서도 인과적으로 정확한 계획 수립을 보장한다. 제안된 방법은 비확률적 환경에서 비인과적 부분 모델보다 우수한 정책 평가 및 계획 성능을 달성하며, 계산 오버헤드를 최소화한다.

ABSTRACT

In reinforcement learning, we can learn a model of future observations and rewards, and use it to plan the agent's next actions. However, jointly modeling future observations can be computationally expensive or even intractable if the observations are high-dimensional (e.g. images). For this reason, previous works have considered partial models, which model only part of the observation. In this paper, we show that partial models can be causally incorrect: they are confounded by the observations they don't model, and can therefore lead to incorrect planning. To address this, we introduce a general family of partial models that are provably causally correct, yet remain fast because they do not need to fully model future observations.

연구 동기 및 목표

  • 기존 모델 기반 강화학습에서 사용되는 부분 모델의 인과적 결함을 식별하고 공식화한다.
  • 관측되지 않은 관측치로 인해 인과적 추론이 왜곡되고 잘못된 계획이 이끌어지는 부분 모델의 혼동 문제를 해결한다.
  • 완전한 관측 모델링을 피하면서도 증명 가능하게 인과적으로 정확한 일반적인 부분 모델의 가족을 개발한다.
  • 간단한 MDP, MiniPacman, 3D 환경에서 제안된 CPM 프레임워크를 실험적으로 검증하여 정책 평가 및 계획 정확도 향상을 입증한다.

제안 방법

  • 잠재 배경 변수를 조건부로 설정함으로써 부분 모델이 인과적으로 정확해지도록 하는 인과적 프레임워크를 제안한다. 이 잠재 배경 변수는 관측되지 않은 혼동 요인을 나타낸다.
  • RNN 인코더의 은닉 상태 $ h_t $ 를 기반으로 잠재 배경 변수 $ z_t $ 에 대한 조건부 분포 $ p(z_t | h_t) $ 를 학습하는 모델 아키텍처를 도입한다.
  • 잠재 배경 변수의 분포 $ p(z_t | h_t) $ 를 다량의 딜리클 분포의 혼합으로 모델링하며, 깊이 신경망을 통해 농도 매개변수를 파arameter화하여 배경 변수의 불확실성과 구조를 포착한다.
  • 이중 단계 학습 프로세스를 사용한다: 먼저 행동과 은닉 상태로부터 미래 관측치를 예측하도록 모델을 사전 학습하고, 이후 인과 목표를 통해 모델 예측을 정책 결과와 일치하도록 미세 조정한다.
  • 강제로 행동과 강제로 배경 변수를 사용하여 치환 개입 조건에서의 모델 행동을 평가하기 위해 롤아웃을 수행한다.
  • 트레이젝터리당 다수의 샘플링 포인트를 사용하는 조건부 생성 손실을 적용하여 모델의 강건성과 불확실성 추정 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1모델 기반 강화학습에서 부분 모델이 분포 예측에 정확하더라도, 관측되지 않은 혼동 요인이 존재할 경우 인과적으로 잘못된 결과를 낼 수 있는가?
  • RQ2정책 변화가 있을 때 인과적 정확성을 확보하기 위해 부분 모델에 포함되어야 할 최소한의 변수는 무엇인가?
  • RQ3완전한 관측 모델링을 피하면서도 인과적으로 정확하고 계산적으로 효율적인 부분 모델를 만들 수 있는가?
  • RQ4잠재 배경 변수를 포함함으로써 비확률적 환경에서 정책 평가 및 계획 성능가 어떻게 향상되는가?

주요 결과

  • FuzzyBear 및 AvoidFuzzyBear MDP에서 비인과적 부분 모델(NCPM)은 숲에 방문하는 정책를 최적 정책으로 잘못 평가한다. 그러나 최적 정책는 집에 머무는 것이다.
  • 인과적으로 정확한 부분 모델(CPM)은 AvoidFuzzyBear에서 집에 머무는 것이 최적임을 정확히 식별하며, 모든 정책에 대해 일정한 평가 점수 0.6을 기록하여 진짜 최대 기대 보상과 일치한다.
  • MiniPacman 환경에서 CPM은 NCPM보다 정책 평가 성능이 뛰어나며, 500개의 임의로 생성된 정책에 대해 가치 추정의 평균 제곱 오차가 낮다.
  • 3D 환경에서 CPM은 초기 학습 단계 동안 다양한 실질적인 롤아웃을 유지하며, 정책이 더 결정적으로 변할수록 NCPM에서 관찰되는 과도한 낙관성과는 다르게 행동한다.
  • CPM은 명시적으로 잠재 배경 변수를 모델링함으로써 정책 변화에 강건하며, 잠재 배경 변수가 혼동 요인으로 작용함을 방지한다.
  • 비영이 탐색($\varepsilon$-탐색) 조건에서 CPM은 롤아웃에서 과신을 피하고, 후기 학습 단계에서도 정확한 불확실성 추정을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.