Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Dynamics Models for Model Predictive Agents

Michael Lutter, Leonard Hasenclever|arXiv (Cornell University)|2021. 09. 29.
Reinforcement Learning in Robotics참고 문헌 54인용 수 4
한 줄 요약

이 논문은 모델 예측 제어에서 동역학 모델을 학습하기 위한 설계 선택 사항을 체계적으로 평가한다. 다양한 DeepMind Control Suite 환경에서 모델 자유형 에이전트의 데이터를 사용해 지도 학습을 수행한다. 평가 결과, 평균 제곱 오차(MSE)는 계획 성능을 예측하는 데 부적절하며, 결정론적 모델의 경우 다단계 손실과 앙상블을 조합하고, 확률적 모델의 경우 대규모 앙성블과 입력 노이즈를 사용하는 것이 최적의 구성임을 규명하였다. 이러한 구성은 실제 성능에 가까운 높은 보상과 안정적인 계획을 가능하게 한다.

ABSTRACT

Model-Based Reinforcement Learning involves learning a extit{dynamics model} from data, and then using this model to optimise behaviour, most often with an online extit{planner}. Much of the recent research along these lines presents a particular set of design choices, involving problem definition, model learning and planning. Given the multiple contributions, it is difficult to evaluate the effects of each. This paper sets out to disambiguate the role of different design choices for learning dynamics models, by comparing their performance to planning with a ground-truth model -- the simulator. First, we collect a rich dataset from the training sequence of a model-free agent on 5 domains of the DeepMind Control Suite. Second, we train feed-forward dynamics models in a supervised fashion, and evaluate planner performance while varying and analysing different model design choices, including ensembling, stochasticity, multi-step training and timestep size. Besides the quantitative analysis, we describe a set of qualitative findings, rules of thumb, and future research directions for planning with learned dynamics models. Videos of the results are available at https://sites.google.com/view/learning-better-models.

연구 동기 및 목표

  • 모델 예측 제어를 위한 학습 동역학 모델의 개별 설계 선택 사항의 영향을 고립하고 평가하기 위해.
  • 높은 성능의 계획을 가능하게 하는 피드포워드 신경망 동역학 모델을 훈련하기 위한 최선의 실천 방안을 규명하기 위해.
  • 복잡한 제어 과제에서 모델 정확도(MSE 등)가 실제 계획 성능과 상관관계가 있는지 평가하기 위해.
  • 고차원 시스템(예: 히ュ먼로이드)에서 발생하는 실패 모드(예: 모델 악용, 불안정성)를 조사하기 위해.
  • 특히 실세계 구현을 위한 모델 기반 강화 학습에서의 모델 학습을 위한 실용적인 지침을 제공하기 위해.

제안 방법

  • DeepMind Control Suite의 다섯 개의 연속 제어 환경에서 사전 훈련된 모델 자유형 에이전트로부터 풍부한 데이터셋을 수집하였다.
  • 상태와 동작을 입력으로 사용하여 상태 전이를 예측하기 위해 피드포워드 신경망을 지도 학습 방식으로 훈련시켰다.
  • 다양한 설계 선택 사항(결정론적 vs. 확률적 모델, 1단계 vs. 다단계 손실, 앙상블 사용 여부, 입력 노이즈 증강)을 변화시켜 계획기 성능을 평가하였다.
  • 고정된 계획 수평선을 가진 모델 예측 제어(MPC)를 사용하여 성능을 평가하였으며, 학습된 모델을 기준 시뮬레이터와 비교하였다.
  • 기대 및 도달한 누적 보상으로 계획 성능을 정량화하고, 보상 차이를 분석하여 모델 악용 여부를 탐지하였다.
  • 장기적인 수평선에서의 예측 정확도와 안정성을 평가하기 위해 오픈 루프 롤아웃에 대한 정성적 분석을 수행하였다.

실험 결과

연구 질문

  • RQ1다양한 모델 학습 설계 선택 사항(예: 확률성, 다단계 손실, 앙상블, 입력 노이즈)이 모델 예측 제어에서 계획 성능에 어떻게 영향을 미치는가?
  • RQ2학습된 동역학 모델을 사용할 때 평균 제곱 오차(MSE)가 실제 계획 성능과 얼마나 상관관계가 있는가?
  • RQ3어떤 모델은 단순한 과제에서는 잘 작동하지만, 고차원 시스템(예: 히ュ먼로이드)에서는 왜 실패하는가?
  • RQ4입력 노이즈는 특히 확률적 모델의 경우 모델의 강건성 향상에 어떤 역할을 하는가?
  • RQ5기대 수익과 실제 수익 간의 보상 차이 분석을 통해 모델 악용을 탐지하고 완화할 수 있는가?

주요 결과

  • 평균 제곱 오차(MSE)는 1단계든 다단계든 계획 성능을 예측하는 데 신뢰할 수 없으며, 높은 MSE를 가진 모델도 높은 보상을 달성할 수 있다.
  • 결정론적 모델의 경우, 다단계 손실과 앙상블을 조합하는 것이 높고 안정적인 계획 성능을 달성하기 위해 필수적이다.
  • 확률적 모델은 높은 보상을 달성하기 위해 대규모 앙상블 크기와 훈련 중 입력 노이즈를 모두 필요로 하며, 특히 볼 인 컵과 같은 과제에서는 입력 노이즈가 핵심 요소이다.
  • 히ュ먼로이드 환경에서는 모든 학습된 모델에서 일관되게 실패하며, 발산하는 오픈 루프 트레이젝터리와 매우 과도하게 낙관적인 보상 추정치를 나타낸다.
  • 모델 악용은 흔히 비선형성이 강한 시스템(예: 접촉 동역학)에서 발생하며, 불연속성 근처의 정확하지 못한 모델링으로 인해 계획기가 미래 보상을 과도하게 추정하기 때문이다.
  • 고 MSE를 가진 일부 모델—특히 굵은 시간 간격을 사용하는 경우—는 높은 보상을 달성하는데, 이는 정밀한 궤적 모델링보다는 구조적 정확성(예: 볼 인 컵에서의 터널링 방지)을 확보하는 것이 더 중요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.