Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Discretize: Solving 1D Scalar Conservation Laws via Deep Reinforcement Learning

Yufei Wang, Ziju Shen|arXiv (Cornell University)|2019. 05. 27.
Model Reduction and Neural Networks참고 문헌 44인용 수 5
한 줄 요약

이 논문은 1차 스칼라 보존 법칙을 해결하기 위한 적응형 수치 이산화를 학습하기 위해 딥 강화학습(DRL) 프레임워크를 제안한다. 해법 과정을 순차적 결정 문제로 간주하며, 정책 네트워크를 학습시켜 국소 해상태에 기반해 최적의 유한차분 스텐실을 동적으로 선택함으로써 WENO 스킴과 L3D, PINNs와 같은 지도학습 기반 베이스라인에 비해 뛰어난 정확도와 일반화 성능을 달성한다.

ABSTRACT

Conservation laws are considered to be fundamental laws of nature. It has broad applications in many fields, including physics, chemistry, biology, geology, and engineering. Solving the differential equations associated with conservation laws is a major branch in computational mathematics. The recent success of machine learning, especially deep learning in areas such as computer vision and natural language processing, has attracted a lot of attention from the community of computational mathematics and inspired many intriguing works in combining machine learning with traditional methods. In this paper, we are the first to view numerical PDE solvers as an MDP and to use (deep) RL to learn new solvers. As proof of concept, we focus on 1-dimensional scalar conservation laws. We deploy the machinery of deep reinforcement learning to train a policy network that can decide on how the numerical solutions should be approximated in a sequential and spatial-temporal adaptive manner. We will show that the problem of solving conservation laws can be naturally viewed as a sequential decision-making process, and the numerical schemes learned in such a way can easily enforce long-term accuracy. Furthermore, the learned policy network is carefully designed to determine a good local discrete approximation based on the current state of the solution, which essentially makes the proposed method a meta-learning approach. In other words, the proposed method is capable of learning how to discretize for a given situation mimicking human experts. Finally, we will provide details on how the policy network is trained, how well it performs compared with some state-of-the-art numerical solvers such as WENO schemes, and supervised learning based approach L3D and PINN, and how well it generalizes.

연구 동기 및 목표

  • 정확도와 내구성의 균형을 이루는 고차수의 적응형 수치 해법을 설계하는 데 도전하는 것.
  • WENO 스킴 등에서 볼 수 있듯이 전문가가 설계한 규칙과 히وري스틱에 의존하는 전통적 방법의 한계를 극복하는 것.
  • 초기 학습 없이도 장기적인 해상 정확도와 이산화 결정을 통합하는 엔드 투 엔드 학습 프레임워크를 개발하는 것.
  • 강화학습이 숙련된 결정 방식을 모방하는 메타-학습 정책을 학습시킬 수 있는지 탐색하는 것.
  • 학습 분포 외의 다양한 초기 조건과 방정식 설정(비점성, 점성, 외력)에 대해 일반화 성능을 평가하는 것.

제안 방법

  • 수치 해법 과정을 마르코프 결정 과정(MDP)으로 모델링하며, 각 공간-시간 단계는 결정 상태에 해당한다.
  • 딥 강화학습을 통해 국소 해 특징에 기반해 최적의 유한차분 스텐실(유량 근사)을 선택하는 정책 네트워크를 학습시킨다.
  • 행동 공간은 수치 유량 스킴의 이산적 선택을 표현하며, 보상은 장기적 정확도와 안정성을 장려하도록 설계된다.
  • 메타-학습 설계를 통해 정책은 현재 해상 상태에 따라 이산화 전략을 적응적으로 조정하며 숙련된 행동을 모방한다.
  • DRL 에이전트는 시간에 따른 오차 누적에 대한 페널티를 주는 보상 함수를 사용하여 장기 수준의 정확도를 촉진한다.
  • 프레임워크는 다양한 초기 조건과 외력 항을 가진 점성 및 비점성 버거스 방정식에서 평가된다.

실험 결과

연구 질문

  • RQ11차 스칼라 보존 법칙을 해석하는 과정이 강화학습에 적합한 순차적 결정 문제로 자연스럽게 프레임워크화될 수 있는가?
  • RQ2딥 강화학습 에이전트가 국소적으로 적응하는 수치 유량 정책을 학습시켜 고정된 고차수 스킴인 WENO보다 더 높은 정확도를 달성할 수 있는가?
  • RQ3학습된 RL 기반 해법이 L3D, PINNs와 같은 지도학습 방법보다 분포 외 테스트 케이스에 대해 더 잘 일반화되는가?
  • RQ4DRL 에이전트가 국소 해 특징에 기반해 이산화 전략을 선택하는 메타-학습 정책을 학습시켜 숙련된 지식을 모방할 수 있는가?
  • RQ5RL 기반 해법의 성능은 다양한 PDE 설정에서 장기적 정확도와 내구성 측면에서 어떻게 비교되는가?

주요 결과

  • RL 기반 해법인 RL-WENO는 점성 및 비점성 버거스 방정식을 포함한 모든 테스트 설정에서 WENO보다 낮은 상대 오차를 기록했다.
  • Δx = 0.02 및 η = 0.01 조건에서 점성 버거스 방정식에서 RL-WENO는 상대 오차 1.64 (±0.57)를 기록했으며, WENO의 1.94 (±0.55)를 초월했다.
  • 외력 테스트 설정에서는 RL-WENO가 잘 일반화되어 Δx = 0.01에서 상대 오차 4.66 (±0.72)를 기록했고, WENO의 4.74 (±0.70)보다 우수했다.
  • 학습 시점에 점성 설정에서 훈련된 RL-WENO 정책은 비점성 테스트 케이스에서 1.01 (±0.19)의 오차를 기록했으며, WENO의 1.02 (±0.27)를 능가했다.
  • L3D와 PINNs와 달리, 분포 이탈 상황에서 실패하거나 발산하지 않고 RL-WENO는 다양한 테스트 구성에서 안정적이고 정확한 성능을 유지했다.
  • 이 방법은 강력한 분포 외 일반화 성능을 보였으며, 비점성, 점성, 외력 설정 모두에서 일관된 성능을 기록하여 강력한 정책 학습을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.