Skip to main content
QUICK REVIEW

[논문 리뷰] Physics-Informed Model-Based Reinforcement Learning

Adithya Ramesh, Balaraman Ravindran|arXiv (Cornell University)|2022. 12. 05.
Reinforcement Learning in Robotics인용 수 9
한 줄 요약

이 논문은 다양한 물리 법칙을 반영하는 미분 가능한 물리 기반 신경망(PINNs)을 활용하여 표본 효율성과 로봇 제어 작업에서의 성능을 향상시키는 물리 기반 모델 기반 강화학습(MBRL) 프레임워크를 제안한다. 물리 법칙을 준수하는 동역학 모델을 훈련시킴으로써, 이 방법은 혼돈스럽고 초기 조건에 민감한 환경에서 표준 MBRL보다 훨씬 높은 평균 수익과 표본 효율성을 달성하며, Soft Actor-Critic과 같은 최첨단 모델리스 알고리즘을 능가한다.

ABSTRACT

We apply reinforcement learning (RL) to robotics tasks. One of the drawbacks of traditional RL algorithms has been their poor sample efficiency. One approach to improve the sample efficiency is model-based RL. In our model-based RL algorithm, we learn a model of the environment, essentially its transition dynamics and reward function, use it to generate imaginary trajectories and backpropagate through them to update the policy, exploiting the differentiability of the model. Intuitively, learning more accurate models should lead to better model-based RL performance. Recently, there has been growing interest in developing better deep neural network based dynamics models for physical systems, by utilizing the structure of the underlying physics. We focus on robotic systems undergoing rigid body motion without contacts. We compare two versions of our model-based RL algorithm, one which uses a standard deep neural network based dynamics model and the other which uses a much more accurate, physics-informed neural network based dynamics model. We show that, in model-based RL, model accuracy mainly matters in environments that are sensitive to initial conditions, where numerical errors accumulate fast. In these environments, the physics-informed version of our algorithm achieves significantly better average-return and sample efficiency. In environments that are not sensitive to initial conditions, both versions of our algorithm achieve similar average-return, while the physics-informed version achieves better sample efficiency. We also show that, in challenging environments, physics-informed model-based RL achieves better average-return than state-of-the-art model-free RL algorithms such as Soft Actor-Critic, as it computes the policy-gradient analytically, while the latter estimates it through sampling.

연구 동기 및 목표

  • 로봇 제어 작업에서 전통적인 강화학습(RL)의 열악한 표본 효율성 문제 해결.
  • 학습된 동역학 모델에 물리적 제약 조건을 통합하여 모델 기반 강화학습의 표본 효율성 향상.
  • 초기 조건에 민감한 환경에서 물리 기반 동역학 모델이 정책 학습에 더 나은 성능을 내는지 조사.
  • 모델 기반 강화학습에서 정책 기울기의 분석적 계산이 Soft Actor-Critic과 같은 샘플 기반 방법을 능가할 수 있는지 입증.
  • 강제로 작용하는 비선형 자율 동역학계에 대해 리아프노프 지수 추정을 위한 변분 방정식을 확장하여 초깃값에 대한 민감도를 정량화.

제안 방법

  • 에너지 보존과 같은 물리 법칙을 준수하는, 미분 가능한 물리 기반 신경망(PINN) 동역학 모델 훈련.
  • 시간에 따라 역전파하는 방식으로 상상의 궤적을 생성하여 정책 최적화.
  • 실제 궤적 수집과 상상의 궤적을 사용한 모델 및 정책 업데이트를 번갈아가며 수행하는 하이브리드 훈련 방식 도입.
  • 강제로 작용하는 시스템에 대해 확장된 변분 방정식을 사용해 유한 시간 최대 리아프노프 지수를 계산하여 초깃값 민감도를 정량화.
  • 상상의 궤적을 통해 기울기를 역전파하여 정책을 업데이트하는 모델 기반 RL 알고리즘을 사용하여 정책 기울기의 분석적 계산을 가능하게 함.
  • 표준 딥 뉴럴 네트워크(DNN) 동역학 모델을 사용하는 버전과 물리 기반 신경망(LNN) 동역학 모델을 사용하는 버전의 두 가지 변종 비교.

실험 결과

연구 질문

  • RQ1물리 기반 동역학 모델을 사용할 경우, 로봇 시스템의 모델 기반 강화학습에서 표본 효율성과 최종 성능이 향상되는가?
  • RQ2특히 초깃값에 민감한 환경에서, 동역학 모델의 정확도가 MBRL 성능에 가장 크게 영향을 미치는 환경의 유형은 무엇인가?
  • RQ3어려운 제어 과제에서 물리 기반 모델 기반 강화학습은 Soft Actor-Critic과 같은 최첨단 모델리스 알고리즘보다 성능이 뛰어나게 되는가?
  • RQ4유한 시간 최대 리아프노프 지수는 표준 모델과 물리 기반 모델 간의 MBRL 성능 차이를 신뢰할 만한 예측 도구로 활용할 수 있는가?
  • RQ5모델 기반 강화학습에서 분석적 정책 기울기 계산이 모델리스 방법의 샘플 기반 추정에 비해 얼마나 뛰어나게 성능을 높이는가?

주요 결과

  • 초깃값에 민감한 환경—예를 들어 Cart-2-pole, Acrobot, Cart-3-pole—에서는 물리 기반 MBRL 버전이 표준 DNN 기반 MBRL보다 유의미하게 높은 평균 수익을 달성한다.
  • 모든 환경에서 물리 기반 MBRL는 뛰어난 표본 효율성을 보이며, 특히 수치 오차가 빠르게 누적되는 혼돈스러운 시스템에서 가장 큰 성과를 보인다.
  • 초깃값 민감도가 낮은 환경인 Reacher와 Pendulum에서는 두 MBRL 버전이 유사한 평균 수익을 기록하지만, 물리 기반 버전은 여전히 더 뛰어난 표본 효율성을 보인다.
  • 물리 기반 모델 기반 강화학습은 정책 기울기의 분석적 계산 방식 덕분에 샘플 기반 추정 방식을 사용하는 Soft Actor-Critic보다 어려운 환경에서 평균 수익 측면에서 뛰어나다.
  • 강제로 작용하는 시스템에 대해 확장된 변분 방정식을 사용해 계산한 유한 시간 최대 리아프노프 지수는 모델 정확도가 성능에 결정적인 영향을 미치는 환경을 성공적으로 식별한다.
  • LNN 기반 동역학 모델은 장기간에 걸쳐서 DNN 모델 대비 더 낮은 동역학 오차와 더디게 누적되는 궤적 오차를 보이며, 더 안정적이고 정확한 상상의 궤적을 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.