Skip to main content
QUICK REVIEW

[논문 리뷰] Equivalence Between Wasserstein and Value-Aware Loss for Model-based Reinforcement Learning

Kavosh Asadi, Evan Cater|arXiv (Cornell University)|2018. 06. 01.
Reinforcement Learning in Robotics참고 문헌 16인용 수 9
한 줄 요약

이 논문은 모델기반 강화학습에서 값 인식 모델 학습(VAML)과 워샤프스키 거리(Wasserstein metric) 사이의 이론적 동치성을 수립한다. MDP의 가치 함수가 리프시츠 연속임을 증명함으로써, 저자들은 VAML 목적함수를 최소화하는 것이 전이 분포 간 워샤프스키 거리 최소화와 수학적으로 동치임을 보여주며, 워샤프스키 거리의 모델 학습에 응용하기 위한 이론적 기반을 제공한다.

ABSTRACT

Learning a generative model is a key component of model-based reinforcement learning. Though learning a good model in the tabular setting is a simple task, learning a useful model in the approximate setting is challenging. In this context, an important question is the loss function used for model learning as varying the loss function can have a remarkable impact on effectiveness of planning. Recently Farahmand et al. (2017) proposed a value-aware model learning (VAML) objective that captures the structure of value function during model learning. Using tools from Asadi et al. (2018), we show that minimizing the VAML objective is in fact equivalent to minimizing the Wasserstein metric. This equivalence improves our understanding of value-aware models, and also creates a theoretical foundation for applications of Wasserstein in model-based reinforcement~learning.

연구 동기 및 목표

  • 표준 최대우도 추정 목적함수들이 누적 오차로 인해 실패하는 근사 모델기반 강화학습 환경에서 유용한 모델을 학습하는 데 도전하는 것.
  • 모델 정확도가 떨어지는 상황에서도 가치 인식 모델 학습(VAML)이 계획 성능을 향상시키는 이유를 이해하는 것.
  • 워샤프스키 거리로 나타나는 최적 운반 이론(optimal transport)과 VAML 간의 이론적 연결을 수립하는 것.
  • VAML를 최소화하는 것이 가치 함수의 리프시츠 연속성 하에서 워샤프스키 거리 최소화와 동치임을 보이는 것.

제안 방법

  • 수축 사상과 복합 레미마를 사용하여 유한한 보상과 전이 동역학을 가진 MDP에서 가치 함수가 리프시츠 연속임을 증명한다.
  • 보상과 전이 동역학으로부터 유도된 유한한 리프시츠 상수 C를 가진 리프시츠 함수의 공간 𝒮_C를 정의한다.
  • VAML 목적함수를 리프시츠 함수 위의 Supremum로 재구성함으로써, 이가 워샤프스키 거리의 칸토로비치-루빈스타인 쌍대 형태와 동치임을 보여준다.
  • VAML 목적함수를 최소화하는 것이 진짜 전이 분포와 예측된 전이 분포 간의 워샤프스키 거리 최소화와 동치임을 수립한다.
  • 이 동치성을 바탕으로 워샤프스키 거리 최소화가 자연스럽게 가치 인식 모델 학습을 장려함을 논증한다.
  • 실용적인 워샤프스키 기반 모델 학습을 위한 GAN과 엔트로피 정규화 기반의 향후 연구 방향을 제안한다.

실험 결과

연구 질문

  • RQ1표준 MDP 가정 하에서 MDP의 가치 함수는 리프시츠 연속인가?
  • RQ2VAML 목적함수는 최적 운반 이론의 알려진 거리 측도와 공식적으로 연결될 수 있는가?
  • RQ3전이 분포 간 워샤프스키 거리 최소화가 최대우도 추정보다 계획에 더 유용한 모델을 제공하는가?
  • RQ4VAML를 최소화하는 것이 워샤프스키 거리 최소화와 동치가 되기 위한 조건은 무엇인가?
  • RQ5VAML와 워샤프스키 간의 이론적 동치성을 바탕으로 더 나은 모델 학습 알고리즘을 설계할 수 있는가?

주요 결과

  • 유한한 보상과 전이 동역학 하에서 MDP의 가치 함수는 리프시츠 연속이며, 리프시츠 상수 C = K^𝒜_d𝒮,dR(R) / (1 - γK_d𝒮,W(T))를 가진다.
  • VAML 목적함수는 전이 분포 간 제곱 워샤프스키 거리 최소화와 수학적으로 동치이며, 이는 C²로 스케일링된다.
  • VAML 목적함수를 최소화함으로써 모델은 후속 계획 수립을 위해 최적화됨을 보장하며, 이는 가치 함수의 구조와 일치하기 때문이다.
  • 이 동치성은 워샤프스키 거리가 모델기반 RL에서 사용될 때 자연스럽게 가치 인식 모델 학습을 장려하므로, 이론적 근거를 제공한다.
  • 결과적으로 워샤프스키 거리 간의 전이 분포 최소화를 수행하는 알고리즘은 최대 벨먼 오차를 암묵적으로 최소화함으로써 계획 성능 향상을 이룬다.
  • 이 동치성은 가치 함수가 리프시츠임을 전제로 하며, 이는 보상과 동역학이 유한한 표준 MDP에서 만족됨이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.