Skip to main content
QUICK REVIEW

[논문 리뷰] Value Gradient weighted Model-Based Reinforcement Learning

Claas Voelcker, Victor Liao|arXiv (Cornell University)|2022. 04. 04.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 모델 기반 강화 학습에서 표본 효율성과 견고성을 향상시키기 위해 가치 함수 추정에 미치는 영향이 큰 상태 차원을 우선순위로 삼는 값-기울기 가중 모델 손실인 VaGraM을 제안한다. 경험적 가치 함수의 기울기를 모델 손실에 통합함으로써 VaGraM은 학습을 안정화시키고, Mujoco 벤치마크에서 최대우도 추정 방법과 비슷한 성능을 달성한다. 특히 모델 용량이 작거나 상태 차원에 노이즈가 있는 경우에 유의미하게 성능 향상을 보인다.

ABSTRACT

Model-based reinforcement learning (MBRL) is a sample efficient technique to obtain control policies, yet unavoidable modeling errors often lead performance deterioration. The model in MBRL is often solely fitted to reconstruct dynamics, state observations in particular, while the impact of model error on the policy is not captured by the training objective. This leads to a mismatch between the intended goal of MBRL, enabling good policy and value learning, and the target of the loss function employed in practice, future state prediction. Naive intuition would suggest that value-aware model learning would fix this problem and, indeed, several solutions to this objective mismatch problem have been proposed based on theoretical analysis. However, they tend to be inferior in practice to commonly used maximum likelihood (MLE) based approaches. In this paper we propose the Value-gradient weighted Model Learning (VaGraM), a novel method for value-aware model learning which improves the performance of MBRL in challenging settings, such as small model capacity and the presence of distracting state dimensions. We analyze both MLE and value-aware approaches and demonstrate how they fail to account for exploration and the behavior of function approximation when learning value-aware models and highlight the additional goals that must be met to stabilize optimization in the deep learning setting. We verify our analysis by showing that our loss function is able to achieve high returns on the Mujoco benchmark suite while being more robust than maximum likelihood based approaches.

연구 동기 및 목표

  • 모델 학습이 상태 예측 정확도에 집중하지만 정책 성능에는 초점을 맞추지 않는 모델 기반 강화 학습에서의 목표 불일치 문제를 해결한다.
  • 최대우도 추정(MLE)이 모델 오차가 후속 계획 수립 및 정책 최적화에 미치는 영향을 고려하지 못함으로써 발생하는 MBRL의 한계를 극복한다.
  • 심층 학습 환경에서 최적화 궤적의 불안정성과 초기 학습 시 충분한 커버리지 부족 문제를 해결함으로써 가치 인식 모델 학습을 안정화시킨다.
  • 불필요하거나 혼란스러운 상태 차원과 작은 모델 용량에 대해 견고성을 향상시키며, MLE 기반 모델이 심각하게 성능 저하되는 상황을 개선한다.
  • 모델 학습을 가치 함수의 모델 오차에 대한 민감도와 일치시키기 위한 일반적인 목적, 미분 가능한 손실 함수를 개발한다.

제안 방법

  • 예측된 상태에 대한 경험적 가치 함수의 기울기를 사용해 평균제곱오차(MSE) 손실을 재가중하는 새로운 모델 손실 함수인 VaGraM을 제안한다.
  • 가치 함수 기울기의 크기를 정책이 모델 오차에 얼마나 민감한지에 대한 지표로 사용함으로써, 가치 추정에 큰 영향을 미치는 상태 차원을 우선순위로 학습한다.
  • 표준 MBRL 파이프라인에 VaGraM을 통합하여, 모델 피팅 중 표준 MLE 기반 모델 학습을 가치 인식 지도 학습으로 대체한다.
  • 가치 함수의 미분 가능한 근사치를 사용해, 종단 간 학습 중에 동적 모델을 정책 관련 영역으로 유도하는 손실을 적용한다.
  • MBPO 기반의 MBRL-Lib 프레임워크에서 모듈러한 구성 요소로 구현함으로써, 표준 MBRL 프레임워크와의 확장성과 호환성을 확보한다.
  • 경험적 가치 함수 기울기를 활용해 각 상태 차원에 대해 동적으로 손실 가중치를 조정함으로써, 상태 공간의 고영향 영역에 모델 업데이트를 집중시킨다.

실험 결과

연구 질문

  • RQ1심층 학습 환경에서 이론적으로 타당한 가치 인식 모델 학습 접근법이 실질적으로 MLE를 능가하지 못하는 이유는 무엇인가?
  • RQ2함수 근사와 최적화 궤적이 심층 네트워크에서 불안정성을 유발할 때, 가치 인식 모델 학습을 어떻게 안정화시킬 수 있는가?
  • RQ3가치 함수 기울기의 통합이 낮은 용량 또는 고차원 상태 공간에서 모델 일반화 및 정책 성능에 얼마나 기여하는가?
  • RQ4혼란스럽거나 불필요한 상태 차원이 존재하는 환경에서, 가치-기울기 가중 손실이 MLE 기반 모델 학습을 능가할 수 있는가?
  • RQ5모델 용량이 제한되거나 학습 데이터가 희소한 환경에서 VaGraM은 어떻게 견고성을 향상시키는가?

주요 결과

  • 큰 신경망 모델을 사용할 경우, VaGraM은 Mujoco 벤치마크 세트에서 최대우도 추정과 비슷한 성능을 달성한다.
  • 모델 용량이 작은 설정에서는 VaGraM이 MLE 기반 모델을 크게 능가하며, 표본 효율성과 견고성 향상을 입증한다.
  • 불필요하거나 혼란스러운 상태 차원으로 인한 성능 저하를 줄이며, 이러한 노이즈가 존재하는 상황에서도 높은 정책 수익을 유지한다.
  • 이전의 가치 인식 접근법에서 야기되는 최적화 궤적의 불안정성을 해결함으로써, VaGraM은 학습 과정을 안정화시킨다.
  • 가치 기울기 가중 메커니즘이 가치 함수에 큰 영향을 미치는 상태 차원의 학습을 효과적으로 우선순위로 삼아, 더 나은 정책 일반화를 이끈다.
  • 경험적 결과는 VaGraM이 정책 최적화에 중요한 영역에서 상태 예측 정확도와 가치 예측 정확도를 모두 향상시킨다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.