Skip to main content
QUICK REVIEW

[논문 리뷰] Is it time to swish? Comparing activation functions in solving the Helmholtz equation using physics-informed neural networks

Ali Al-Safwan, Chao Song|arXiv (Cornell University)|2021. 10. 11.
Model Reduction and Neural Networks참고 문헌 7인용 수 6
한 줄 요약

이 논문은 지진파장 모델링에서 헬름홀츠 방정식을 해결하는 데 있어 물리 기반 신경망(PINNs)의 성능에 영향을 미치는 다양한 활성화 함수의 영향을 조사한다. 스위시(softplus 유사) 활성화 함수가 흔히 사용되는 탄젠트(hyperbolic tangent, tanh), 아타논(atan), 그리고 ELU(Exponential Linear Unit)와 비교해 수렴 속도와 해의 정확도를 크게 향상시킴을 입증한다. 특히 급격한 속도 이방성 구조를 가진 모델에서 두드러진 성능 향상을 보인다.

ABSTRACT

Solving the wave equation numerically constitutes the majority of the computational cost for applications like seismic imaging and full waveform inversion. An alternative approach is to solve the frequency domain Helmholtz equation, since it offers a reduction in dimensionality as it can be solved per frequency. However, computational challenges with the classical Helmholtz solvers such as the need to invert a large stiffness matrix can make these approaches computationally infeasible for large 3D models or for modeling high frequencies. Moreover, these methods do not have a mechanism to transfer information gained from solving one problem to the next. This becomes a bottleneck for applications like full waveform inversion where repeated modeling is necessary. Therefore, recently a new approach based on the emerging paradigm of physics informed neural networks (PINNs) has been proposed to solve the Helmholtz equation. The method has shown promise in addressing several challenging associated with the conventional algorithms, including flexibility to model additional physics and the use of transfer learning to speed up computations. However, the approach still needs further developments to be fully practicable. Foremost amongst the challenges is the slow convergence speed and reduced accuracy, especially in presence of sharp heterogeneities in the velocity model. Therefore, with an eye on exploring how improved convergence can be obtained for the PINN Helmholtz solvers, we study different activation functions routinely used in the PINN literature, in addition to the swish activation function - a variant of ReLU that has shown improved performance on a number of data science problems. Through a comparative study, we find that swish yields superior performance compared to the other activation functions routinely used in the PINN literature.

연구 동기 및 목표

  • 급격한 속도 이방성 존재 시 PINN 기반의 헬름홀츠 해법에서 느린 수렴과 정확도 저하 문제를 해결하기 위해.
  • 파장 모델링을 위한 PINN의 학습 동역학과 해 품질에 영향을 미치는 다양한 활성화 함수의 영향을 평가하기 위해.
  • 딥러닝에서 뛰어난 성능을 보이는 것으로 알려진 스위시 활성화 함수가 헬름홀츠 방정식 해법에 있어 PINN 성능을 향상시키는지 확인하기 위해.
  • 파동 전파에 대한 물리 기반 딥러닝에서 수렴을 가속화하고 정확도를 향상시키기 위해 최적의 활성화 함수 선택에 대한 경험적 증거를 제공하기 위해.

제안 방법

  • 연구는 이중 산산산산 속도 모델에서 헬름홀츠 방정식의 리플만-슈윙거 형태를 해결하기 위해 물리 기반 신경망(PINN)을 사용한다.
  • PINN는 공간 도함수를 계산하기 위해 자동 미분를 활용한 잔차를 강제로 만족시키는 손실 함수를 사용해 훈련된다.
  • 8개의 완전 연결 히든 레이어를 각각 20개의 뉴런으로 구성하고, 배치 크기가 256인 Adam 옵timizer를 사용해 총 15,000 에포크 동안 훈련한다.
  • 다섯 가지 활성화 함수를 비교한다: tanh, atan, ELU, 그리고 스위시(부드럽고 비단조화적인 ReLU 변형). 모든 초모수는 공정한 비교를 위해 동일하게 유지된다.
  • PINN의 구현과 손실 함수 계산에는 고수준의 Keras/TensorFlow 래퍼인 SciANN 패키지를 사용한다.
  • 수렴성은 손실 역사 곡선을 통해 평가하고, 해의 정확도는 파장장의 실수부와 허수부에 대해 L2 및 L∞ 노름을 사용해 정량화한다.

실험 결과

연구 질문

  • RQ1스위시 활성화 함수는 tanh, atan, ELU와 같은 표준 활성화 함수에 비해 PINN 기반의 헬름홀츠 해법에서 수렴 속도와 정확도를 향상시키는가?
  • RQ2급격한 속도 대비가 존재하는 헬름홀츠 방정식 해법에서 다양한 활성화 함수는 PINN의 학습 동역학에 어떻게 영향을 미치는가?
  • RQ3스위시의 향상된 기울기 흐름 특성은 고주파 파장장 문제를 학습하는 PINN에서의 기울기 소멸 문제를 완화시킬 수 있는가?
  • RQ4활성화 함수의 선택이 전형적인 파동장 반복 모델링 응용 분야, 예를 들어 전체파형 역설계(Full Waveform Inversion)에서 PINN의 실현 가능성에 얼마나 큰 영향을 미치는가?

주요 결과

  • 스위시 활성화 함수는 가장 빠른 수렴 속도를 보이며, 첫 2,000 에포크 동안 다른 함수들인 tanh, atan, ELU보다 손실이 더 빠르게 감소한다.
  • 스위시는 실수부와 허수부 파장장 구성요소 모두에서 가장 낮은 L2 오차를 기록한다: 실수부는 3.65×10⁻⁵, 허수부는 4.7×10⁻⁵로, 다른 모든 활성화 함수를 능가한다.
  • 스위시는 가장 작은 L∞ 오차를 기록한다: 실수부는 9.86×10⁻³, 허수부는 1.58×10⁻²로, 최대 오차 제어가 더 우수하다.
  • 스위시 활성화 함수를 사용한 PINN는 그림 3에서 볼 수 있듯이, 다른 활성화 함수보다 공간 분포상에서 파장장 오차 크기가 눈에 띄게 낮다.
  • 손실 곡선은 스위시가 더 낮은 평탄한 상태에 더 빨리 도달함을 시사하며, 이는 L-BFGS와 같은 이차 최적화기로의 조기 전환 가능성을 높인다. 이는 수렴 속도를 추가로 가속화할 수 있다.
  • 표준 활성화 함수 중에서는 ELU가 가장 열 劣한 성능을 보이며, 가장 높은 L2 및 L∞ 오차를 기록한다. 반면 tanh와 atan은 유사한 성능을 보이나 스위시에 비해 열 劣하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.