Skip to main content
QUICK REVIEW

[논문 리뷰] Selective Dyna-style Planning Under Limited Model Capacity

Zaheer Abbas, Samuel Sokota|arXiv (Cornell University)|2020. 07. 05.
Artificial Intelligence in Games참고 문헌 43인용 수 6
한 줄 요약

이 논문은 불완전한 모델에서 유해한 계획을 피하기 위해 예측 불확실성을 사용하는 선택적 다이나 스타일 계획을 제안한다. 이론적 불완전성 탐지에 이종분산 회귀를 결합하고 파rameter 불확실성과 융합함으로써, 제한된 모델 용량 조건에서도 강건하고 샘플 효율적인 학습이 가능해지며, 비선택적 계획 및 엔semble 기반 불확실성 추정 방식을 능가한다.

ABSTRACT

In model-based reinforcement learning, planning with an imperfect model of the environment has the potential to harm learning progress. But even when a model is imperfect, it may still contain information that is useful for planning. In this paper, we investigate the idea of using an imperfect model selectively. The agent should plan in parts of the state space where the model would be helpful but refrain from using the model where it would be harmful. An effective selective planning mechanism requires estimating predictive uncertainty, which arises out of aleatoric uncertainty, parameter uncertainty, and model inadequacy, among other sources. Prior work has focused on parameter uncertainty for selective planning. In this work, we emphasize the importance of model inadequacy. We show that heteroscedastic regression can signal predictive uncertainty arising from model inadequacy that is complementary to that which is detected by methods designed for parameter uncertainty, indicating that considering both parameter uncertainty and model inadequacy may be a more promising direction for effective selective planning than either in isolation.

연구 동기 및 목표

  • 모델 기반 강화학습에서 나쁜 모델이 학습에 악영향을 미칠 수 있는 문제를 해결하기 위해.
  • 모델이 신뢰할 수 있는 영역에서만 사용하는 선택적 계획 메커니즘을 개발하기 위해.
  • 제한된 용량 환경에서 예측 불확실성의 주요 원인인 모델 부적합성(파rameter 불확실성과는 다름)의 역할을 조사하기 위해.
  • 파arameter 불확실성과 모델 부적합성의 조합이 각각 독립적으로 사용할 때보다 더 강건한 계획을 가능하게 하는지 평가하기 위해.
  • 이종분산 회귀로 학습된 분산이 표준 불확실성 측정 방법으로는 포착되지 않는 모델 부적합성을 신호로 줄 수 있는지 보여주기 위해.

제안 방법

  • 이 방법은 입력에 따라 예측 분산을 추정하는 이종분산 회귀를 사용하여, 제한된 용량 조건에서 모델 부적합성에 기인한 불확실성을 캡처한다.
  • 선택적 MVE(모델 기반 가치 확장)는 학습된 분산에 기반해 다단계 TD 타겟을 가중치를 부여함으로써, 높은 불확실성 영역에서 모델 의존도를 낮춘다.
  • 이론적 불확실성 추정치를 이종분산 회귀와 엔semble 분산을 융합하여 강건성을 향상시킨다.
  • 예측 분산이 입력에 따라 변할 수 있도록 允허하는 이종분산 손실 함수를 사용해 모델을 훈련함으로써, 모델이 부적합한 영역을 탐지할 수 있도록 한다.
  • 재생 버퍼에서 진짜 제곱 오차와의 상관관계를 통해 불확실성의 품질을 검증함으로써 예측 불확실성의 정확성을 평가한다.
  • 실험에서는 학습된 분산을 사용한 선택적 MVE를 엔semble 분산을 사용한 변형 및 비선택적 MVE와 비교한다.

실험 결과

연구 질문

  • RQ1제한된 모델 용량 조건에서 모델 부적합성에 기인한 예측 불확실성을 효과적으로 탐지하고 선택적 계획에 활용할 수 있는가?
  • RQ2이종분산 회귀 기반 불확실성과 엔semble 기반 불확실성을 융합하면, 각각을 별도로 사용할 때보다 계획의 강건성이 향상되는가?
  • RQ3학습된 분산을 사용한 선택적 계획이 모델이 불완전할 경우 모델 기반 가치 확장에서 치명적인 실패를 방지할 수 있는가?
  • RQ4제한된 용량 조건에서 엔semble 분산의 성능은 시간이 지남에 따라 어떻게 악화되는가? 그 이유는 무엇인가?
  • RQ5이종분산 회귀에서 유도된 예측 불확실성은 파arameter 불확실성과 보완적인 역할을 하여 선택적 계획을 안내하는가?

주요 결과

  • 이종분산 회귀는 표준 파arameter 불확실성 방법으로는 포착되지 않는 모델 부적합성에 기인한 예측 불확실성을 탐지한다.
  • 학습된 분산을 사용한 선택적 MVE는 비선택적 MVE를 능가하며, 모델이 정확하지 않을 경우에도 계획 실패를 방지한다.
  • 엔semble 분산은 초반에는 잘 작동하지만, 예측이 수렴함에 따라 후반에 성능이 붕괴되어 시간이 지남에 따라 신뢰성이 떨어진다.
  • 엔semble과 이종분산 회귀의 병합된 분산은 전체 훈련 과정 동안 각각의 방법보다 진짜 오차와 더 강하게 상관관계를 보인다.
  • 결과적으로 제한된 용량 환경에서 모델 부적합성은 중요한 불확실성 원천이며, 효과적인 선택적 계획을 위해서는 파arameter 불확실성과 함께 이를 함께 다뤄야 한다는 것이 입증되었다.
  • 제안된 방법은 불완전한 모델을 사용하더라도 샘플 효율적인 학습이 가능하며, 종합적인 불확실성 추정 기반 선택적 계획이 비선택적 또는 엔semble 전용 접근보다 우수하고 실현 가능하다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.