[논문 리뷰] Optimizing the optimizer for data driven deep neural networks and physics informed neural networks
이 논문은 소형에서 중형의 딥 네ural 네트워크 및 물리 기반 신경망(PINNs)을 훈련시키는 데 사용되는 일阶 및 이阶 최적화기—Adam, 레벤버그-마르카르트(LM), BFGS, L-BFGS—를 평가한다. 실험 결과, LM 최적화기가 하이퍼파rameter 조정 없이도 기계 정밀도 수준의 수렴을 달성하며, 평균 제곱오차(MSE) 기준으로 Adam을 수개월 수준으로 뛰어넘는 것으로 나타났다. 반면 Adam은 LM의 정확도에 도달하기 위해 최대 26배 더 많은 파라미터가 필요하다.
We investigate the role of the optimizer in determining the quality of the model fit for neural networks with a small to medium number of parameters. We study the performance of Adam, an algorithm for first-order gradient-based optimization that uses adaptive momentum, the Levenberg and Marquardt (LM) algorithm a second order method, Broyden,Fletcher,Goldfarb and Shanno algorithm (BFGS) a second order method and LBFGS, a low memory version of BFGS. Using these optimizers we fit the function y = sinc(10x) using a neural network with a few parameters. This function has a variable amplitude and a constant frequency. We observe that the higher amplitude components of the function are fitted first and the Adam, BFGS and LBFGS struggle to fit the lower amplitude components of the function. We also solve the Burgers equation using a physics informed neural network(PINN) with the BFGS and LM optimizers. For our example problems with a small to medium number of weights, we find that the LM algorithm is able to rapidly converge to machine precision offering significant benefits over other optimizers. We further investigated the Adam optimizer with a range of models and found that Adam optimiser requires much deeper models with large numbers of hidden units containing up to 26x more parameters, in order to achieve a model fit close that achieved by the LM optimizer. The LM optimizer results illustrate that it may be possible build models with far fewer parameters. We have implemented all our methods in Keras and TensorFlow 2.
연구 동기 및 목표
- 소형에서 중형의 신경망에서 주요 최적화기—Adam, LM, BFGS, L-BFGS—의 성능을 평가하기 위해.
- 변동하는 진폭과 일정한 주파수를 가지는 함수, 예를 들어 y = sinc(10x)와 같은 함수에 최적화기가 어떻게 적합하는지 조사하기 위해.
- 물리 기반 신경망(PINNs)에서 최적화기 선택이 모델 적합도 품질과 수렴 속도에 미치는 영향을 평가하기 위해.
- 일阶 최적화기인 Adam과 같은 이阶 최적화기인 LM가 더 적은 파라미터로 더 높은 모델 정확도를 달성할 수 있는지 확인하기 위해.
- 고정밀도 회귀가 필요한 과학적 머신러닝 응용 분야에서 최적화기 선택의 실용적 영향을 탐색하기 위해.
제안 방법
- 20,000개의 훈련 포인트에서 y = sinc(10x) 함수를 피팅하기 위해 20개의 은닉 유닛을 가진 완전 연결 피드포워드 신경망을 훈련시켰다.
- Adam, 레벤버그-마르카르트(LM), BFGS, L-BFGS 최적화기를 사용하여 평균 제곱오차(MSE) 손실 함수를 최소화하였다.
- 모든 최적화기를 Keras와 Tensorflow 2를 사용하여 구현하였으며, LM 및 BFGS에 대해서는 커스텀 통합을 구현하였다.
- Adam의 성능을 향상시키기 위해 모델 아키텍처(1~4개의 밀집층, 16~80개의 은닉 유닛)에 대한 그리드 서치를 수행하였다.
- 1D 버거스 방정식을 PINN를 사용하여 LM 및 BFGS 최적화기를 적용하여 PDE 제약 문제에서의 성능을 테스트하였다.
- 다양한 진폭 성분이 학습되는 순서를 분석하기 위해 훈련 진행 상황을 모니터링하였다.
실험 결과
연구 질문
- RQ1변동 진폭과 일정 주파수를 가지는 어려운 함수를 피팅할 때, 일阶 최적화기(Adam)와 이阶 최적화기(LM, BFGS)는 어떻게 비교되는가?
- RQ2레벤버그-마르카르트 최적화기가 하이퍼파rameter 조정 없이도 Adam보다 더 빠르고 정확한 수렴을 달성할 수 있는가?
- RQ3Adam이 저진폭 성분에서 열악한 수렴을 보일 경우, 이를 보완하기 위해 모델 아키텍처(깊이 및 너비)를 얼마나 증가시켜야 하는가?
- RQ4버거스 방정식 PINN에서 LM 최적화기가 다른 최적화기보다 더 높은 정확도를 달성할 수 있는가?
- RQ5소형에서 중형의 신경망에서 Adam에 비해 LM을 사용할 경우 파라미터 효율성 측면에서 뚜렷한 이점이 있는가?
주요 결과
- 레벤버그-마르카르트(LM) 최적화기는 하이퍼파rameter 조정 없이도 기계 정밀도 수준의 수렴을 달성하였으며, 평균 제곱오차(MSE)를 1×10⁻⁸ 이하로 낮추었다.
- Adam은 4층 모델에서 최대 26배 더 많은 파라미터(13,201 대비 507)가 필요했으며, MSE를 1×10⁻⁶ 이하로 낮추는 데 성공했지만, 여전히 LM의 성능을 따라오지 못했다.
- LM 최적화기는 유일하게 sinc(10x) 함수의 고진폭 및 저진폭 성분을 모두 정확히 피팅할 수 있었으며, Adam, BFGS, L-BFGS는 저진폭 영역에서 실패했다.
- 버거스 방정식 PINN의 경우, LM 최적화기는 이전에 보고된 다른 최적화기 결과보다 더 높은 정확도를 달성하였다.
- LM 최적화기는 빠른 수렴을 보였고, 학습률 또는 동역학 모멘터드 조정이 필요로 하지 않았다. 반면 Adam은 광범위한 하이퍼파rameter 조정이 필요했다.
- 본 연구는 이阶 최적화기인 LM가 과학적 머신러닝 응용 분야에서 특히 더 작은, 더 효율적인 모델을 가능하게 할 수 있음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.