Skip to main content
QUICK REVIEW

[논문 리뷰] Implicit bias with Ritz-Galerkin method in understanding deep learning for solving PDEs

Jihong Wang, Zhi‐Qin John Xu|arXiv (Cornell University)|2020. 02. 19.
Model Reduction and Neural Networks참고 문헌 22인용 수 4
한 줄 요약

이 논문은 원천 항수 $f$ 의 유한한 샘플 포인트만을 가진 경우, 딥 뉴럴 네트워크(DNNs)와 리츠-갈레르킨(R-G) 방법 간의 암묵적 편향을 조사한다. R-G 방법은 낮은 정규성(예: 조각별 선형 또는 특이 함수)의 해를 생성하는 반면, DNNs는 오버파라미터화 조건에서도 주파수 원리(Frequency Principle)에 의해 부드럽고 저주파 성분이 많은 해를 암묵적으로 선호한다. 이 대비는 데이터가 부족한 환경에서 안정적이고 일반화 가능한 해를 도출하는 데 기여하는 DNNs의 핵심 인덕티브 편향을 드러낸다.

ABSTRACT

This paper aims at studying the difference between Ritz-Galerkin (R-G) method and deep neural network (DNN) method in solving partial differential equations (PDEs) to better understand deep learning. To this end, we consider solving a particular Poisson problem, where the information of the right-hand side of the equation f is only available at n sample points, that is, f is known at finite sample points. Through both theoretical and numerical studies, we show that solution of the R-G method converges to a piecewise linear function for the one dimensional (1D) problem or functions of lower regularity for high dimensional problems. With the same setting, DNNs however learn a relative smooth solution regardless of the dimension, this is, DNNs implicitly bias towards functions with more low-frequency components among all functions that can fit the equation at available data points. This bias is explained by the recent study of frequency principle (Xu et al., (2019) [17] and Zhang et al., (2019) [11, 19]). In addition to the similarity between the traditional numerical methods and DNNs in the approximation perspective, our work shows that the implicit bias in the learning process, which is different from traditional numerical methods, could help better understand the characteristics of DNNs.

연구 동기 및 목표

  • 원천 항수 $f$ 의 유한한 샘플만을 가진 경우, DNNs와 전통적인 리츠-갈레르킨(R-G) 방법 간의 해 행동의 근본적 차이를 이해하는 것.
  • DNNs의 암묵적 인덕티브 편향—특히 저주파 성분 선호—가 R-G 방법과 비교해 해에 어떻게 영향을 주는지 조사하는 것.
  • 기저 함수 또는 뉴런 수가 증가함에 따라 두 방법의 해의 정규성 및 안정성 분석.
  • 관찰된 DNN 행동을 주파수 원리(F-Principle)와 연결하여, 희소 데이터 조건에서도 부드러운 보간을 선호하는 이유를 설명하는 것.
  • DNNs가 고차원 또는 오버파라미터화된 환경에서도 R-G 방법이 특이성을 보이는 것과는 달리 잘 조율되고 안정적인 해를 생성함을 보여주는 것.

제안 방법

  • 원천 함수 $f$ 가 $n$ 개의 이산 샘플 포인트에서만 알려진 1D 및 2D 푸아송 문제를 설정하고, 딜리클레 경계 조건을 적용한다.
  • 샘플된 $f$ 를 델타 함수의 선형 조합으로 간주하여 리츠-갈레르킨 방법을 적용함으로써, 기저 함수에 대한 에너지 최소화를 통한 변분 공식을 도출한다.
  • ReLU 또는 사인함수 활성화를 가진 딥 뉴럴 네트워크를 사용하여 PDE의 약한 형태에 해당하는 손실 함수를 경사하강법으로 최소화한다.
  • 특히 $\int \|\bm{\xi}\|^{-2}|\mathcal{F}[h](\bm{\xi})|^{2} d\bm{\xi}$ 최소화에서의 계수 함수 $\Gamma(\bm{\xi})$ 의 행동을 분석함으로써 해의 주파수 성분을 푸리에 분석을 통해 분석한다.
  • 이론적 분석과 수치 실험을 결합하여, 기저 함수 또는 뉴런 수가 증가함에 따라 해의 정규성 및 안정성을 비교한다.
  • DNNs가 저주파 성분을 먼저 피팅하는 경향을 보이는 이유를 설명하기 위해 주파수 원리(F-Principle)에 의존한다.

실험 결과

연구 질문

  • RQ1원천 항수의 유한한 샘플만을 가진 경우, 리츠-갈레르킨과 DNN 방법 간의 해 정규성에 어떤 차이가 있는가?
  • RQ2동일한 데이터 제약 조건 하에서 DNN 방법이 R-G 방법보다 더 부드러운 해를 생성하는 이유는 무엇인가?
  • RQ3주파수 원리는 DNNs의 PDE 해를 풀이할 때 저주파 성분으로의 인덕티브 편향을 어떻게 형성하는가?
  • RQ4기저 함수 또는 뉴런 수를 늘일수록 R-G 및 DNN 방법의 해의 안정성과 정규성에 어떤 영향을 미치는가?
  • RQ5DNNs의 암묵적 편향은 PDE 해를 풀이하는 최적화 지형의 구조와 이론적으로 연결될 수 있는가?

주요 결과

  • 1D 문제에서는 기저 함수의 수가 증가함에 따라 R-G 방법이 기저 유형에 관계없이 항상 조각별 선형 함수로 수렴한다.
  • 2D 문제에서는 기저 함수의 수가 증가함에 따라 R-G 방법이 샘플링 포인트에서 강한 특이성을 보이는 해를 생성한다.
  • DNN 해는 모든 테스트 설정에서 부드럽고 안정적이며, 뉴런 수가 많아져도 특이성이 나타나지 않는다.
  • DNN 방법은 주파수 원리에 의해 설명되는 바와 같이, 저주파 성분이 많은 함수를 암묵적으로 선호함으로써 희소 데이터의 더 부드러운 보간을 이끈다.
  • 이론적 분석에 따르면, DNN의 최적화 목표는 기저의 적응성과 경사하강법의 역학이 결합된 결과로 R-G 방법보다 더 부드러운 함수를 선호한다.
  • 수치 결과는 DNNs가 특히 고차원 또는 오버파라미터화된 영역에서 데이터 부족 조건에서 R-G 방법보다 해의 안정성과 정규성에서 뛰어난 성능을 보임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.