Skip to main content
QUICK REVIEW

[논문 리뷰] SubTSBR to tackle high noise and outliers for data-driven discovery of differential equations

Sheng Zhang, Guang Lin|arXiv (Cornell University)|2019. 07. 17.
Advanced Statistical Methods and Models참고 문헌 52인용 수 9
한 줄 요약

이 논문은 차분 방정식의 데이터 기반 발견에서 고소음 및 이방성에 대해 강건한 성능을 보이는 서브샘플링 기반 임계 희소 베이지안 회귀 방법인 SubTSBR를 제안한다. 반복적으로 데이터의 부분집합을 샘플링하고 희소 베이지안 추론을 적용함으로써, SubTSBR는 특히 소음이 많은 조건에서 TSBR보다 더 높은 정확도를 달성하며, 무작위 초깃값/경계 조건 또는 분기 동역학을 가진 모델의 발견을 가능하게 한다.

ABSTRACT

Data-driven discovery of differential equations has been an emerging research topic. We propose a novel algorithm subsampling-based threshold sparse Bayesian regression (SubTSBR) to tackle high noise and outliers. The subsampling technique is used for improving the accuracy of the Bayesian learning algorithm. It has two parameters: subsampling size and the number of subsamples. When the subsampling size increases with fixed total sample size, the accuracy of our algorithm goes up and then down. When the number of subsamples increases, the accuracy of our algorithm keeps going up. We demonstrate how to use our algorithm step by step and compare our algorithm with threshold sparse Bayesian regression (TSBR) for the discovery of differential equations. We show that our algorithm produces better results. We also discuss the merits of discovering differential equations from data and demonstrate how to discover models with random initial and boundary condition as well as models with bifurcations. The numerical examples are: (1) predator-prey model with noise, (2) shallow water equations with outliers, (3) heat diffusion with random initial and boundary condition, and (4) fish-harvesting problem with bifurcations.

연구 동기 및 목표

  • 고소음 및 이방성에 오염된 데이터로부터 정확하게 지배 차분 방정식을 발견하는 데 도전하는 것.
  • 伝통적 방법이 실패하는 고소음 영역에서 희소 베이지안 회귀의 강건성을 향상시키는 것.
  • 무작위 초깃값 및 경계 조건 또는 분기 동역학 하에서도 유효한 차분 방정식을 발견할 수 있도록 하는 것.
  • 정확도와 이방성에 대한 저항력을 극대화하기 위해 서브샘플링 파라미터(크기 및 서브샘플 수)를 최적화하는 것.
  • 실제 물리 모델에서 소음과 이방성이 존재하는 조건에서 SubTSBR가 임계 희소 베이지안 회귀(TSBR)보다 뛰어난 성능을 보임을 입증하는 것.

제안 방법

  • 전체 데이터셋에서 소음 영향을 줄이기 위해 다수의 더 작은 대표성 있는 데이터 부분집합을 생성하기 위해 서브샘플링을 적용한다.
  • 각 서브샘플에 대해 희소 베이지안 회귀를 적용하여 차분 방정식 선형 모델의 기저 함수 가중치 벡터를 추정한다.
  • 모델 선택 기준을 사용하여 다수의 서브샘플 결과를 통합함으로써 추정의 안정성과 정확도를 향상시킨다.
  • 편향과 분산을 균형 잡기 위해 서브샘플링 크기와 서브샘플 수를 조정된 모델 선택 기준을 사용하여 최적화한다.
  • 가중치 벡터의 희소성을 강제하기 위해 임계 처리를 통합하여 차분 방정식에 관련된 기저 함수만 선택한다.
  • 시간과 상태 변수의 단항식을 특정 차수까지 포함하는 기저 함수 라이브러리를 사용하여 ODE/PDE의 후보 항을 표현한다.

실험 결과

연구 질문

  • RQ1서브샘플링은 고소음 및 이방성이 존재하는 상황에서 희소 베이지안 회귀의 정확도와 강건성에 어떻게 기여하는가?
  • RQ2정확도를 극대화하기 위해 서브샘플링 크기와 서브샘플 수 사이의 최적의 트레이드오프는 무엇인가?
  • RQ3초깃값이나 경계 조건이 무작위로 샘플링되거나 분기 동역학이 존재할 경우, SubTSBR는 차분 방정식을 신뢰성 있게 발견할 수 있는가?
  • RQ4소음이 있는 데이터 하에서 SubTSBR와 TSBR 간의 정량적 정확도 및 안정성은 어떻게 비교되는가?
  • RQ5주어진 신뢰 수준에서 이방성을 신뢰성 있게 배제하기 위해 필요한 최소 서브샘플 수는 얼마인가?

주요 결과

  • 2% 가우시안 소음이 있는 포식자-피식자 모델에서 SubTSBR는 고소음 조건에서 TSBR를 능가하는 차분 방정식 발견 성능을 입증하였다.
  • SubTSBR의 정확도는 서브샘플링 크기가 증가함에 따라 처음에는 증가하다가 감소하는 경향을 보이며, 편향과 분산을 균형 잡는 최적의 크기가 존재함을 시사한다.
  • 서브샘플 수를 늘일수록 정확도가 일관되게 향상되며, 앙상블 평균화가 강건성을 향상시킨다는 것을 시사한다.
  • 주어진 신뢰 수준에서 이방성을 배제하기 위해 필요한 최소 서브샘플 수는 해석적으로 유도할 수 있으며, 실무에서 활용할 수 있다.
  • 무작위 초깃값이 있는 소음이 있는 데이터로부터 SubTSBR는 어류 어획 ODE(dN/dt = -2.818 + 3.837N - 0.965N²)의 정확한 형태를 성공적으로 발견하였다.
  • SubTSBR에서 도출된 모델은 최소 제곱 회귀가 일반화에 실패한 것과는 달리, 훈련 범위를 벗어난 초깃값에 대해서도 시스템 행동을 정확하게 예측하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.