Skip to main content
QUICK REVIEW

[논문 리뷰] On transfer learning of neural networks using bi-fidelity data for uncertainty propagation

Subhayan De, Jolene Britton|arXiv (Cornell University)|2020. 02. 11.
Probabilistic and Robust Engineering Design참고 문헌 64인용 수 10
한 줄 요약

이 논문은 계산적으로 비용이 많이 드는 공학 시스템에서의 불확실성 전파를 위해 신경망을 훈련하기 위해 저해상도 및 고해상도 시뮬레이션 데이터를 결합하는 双해상도 전이학습 프레임워크를 제안한다. 수정된 확률적 경사하강법을 통해 가우시안 프로세스 회귀를 활용해 매개변수 업데이트를 안내함으로써, 표준 훈련에 비해 고해상도 평가 횟수를 줄이며 더 높은 정확도를 달성한다. 이는 세 가지 테스트 케이스에서 표면 모델 성능 향상이 뚜렷하게 나타남을 보여준다.

ABSTRACT

Due to their high degree of expressiveness, neural networks have recently been used as surrogate models for mapping inputs of an engineering system to outputs of interest. Once trained, neural networks are computationally inexpensive to evaluate and remove the need for repeated evaluations of computationally expensive models in uncertainty quantification applications. However, given the highly parameterized construction of neural networks, especially deep neural networks, accurate training often requires large amounts of simulation data that may not be available in the case of computationally expensive systems. In this paper, to alleviate this issue for uncertainty propagation, we explore the application of transfer learning techniques using training data generated from both high- and low-fidelity models. We explore two strategies for coupling these two datasets during the training procedure, namely, the standard transfer learning and the bi-fidelity weighted learning. In the former approach, a neural network model mapping the inputs to the outputs of interest is trained based on the low-fidelity data. The high-fidelity data is then used to adapt the parameters of the upper layer(s) of the low-fidelity network, or train a simpler neural network to map the output of the low-fidelity network to that of the high-fidelity model. In the latter approach, the entire low-fidelity network parameters are updated using data generated via a Gaussian process model trained with a small high-fidelity dataset. The parameter updates are performed via a variant of stochastic gradient descent with learning rates given by the Gaussian process model. Using three numerical examples, we illustrate the utility of these bi-fidelity transfer learning methods where we focus on accuracy improvement achieved by transfer learning over standard training approaches.

연구 동기 및 목표

  • 과학 계산에서 신경망을 훈련하기 위한 고해상도 시뮬레이션 데이터가 제한된 문제를 해결하기 위해.
  • 전이학습을 통해 저해상도 및 고해상도 데이터를 결합하여 정확한 대체 모델을 훈련하는 데 드는 계산 비용을 줄이기 위해.
  • 저해상도 및 고해상도 출력 간의 차이를 모델링하기 위해 가우시안 프로세스를 사용하여 모델 정확도와 일반화 능력을 향상시키기 위해.
  • 층별 미세조정 및 GP 불확실성에 기반한 기울기 업데이트를 활용한 이중해상도 가중치 학습이라는 두 가지 전이학습 전략을 평가하기 위해.
  • 다양한 복잡도와 데이터 부족 수준을 가진 세 가지 공학 문제에서 제안된 방법의 효능을 입증하기 위해.

제안 방법

  • 시스템의 일반적인 입력-출력 행동을 포착하기 위해 저해상도 데이터로 신경망을 훈련하여 기초 모델로 사용한다.
  • 고해상도 데이터를 사용하여 저해상도 네트워크의 상단 레이어만 미세조정함으로써 전이학습을 적용하여 더 높은 정확도로 적응시킨다.
  • 또 다른 경우로, 작은 고해상도 데이터셋을 사용하여 저해상도 예측값을 고해상도 출력으로 매핑하는 별도의 얕은 네트워크를 훈련한다.
  • 저해상도 및 고해상도 출력 간의 오차를 추정하기 위해 가우시안 프로세스 모델을 사용하며, 이는 불확실성 인식 보정을 제공한다.
  • 학습률이 GP의 예측 분산에 따라 동적으로 조정되는 확률적 경사하강법의 변종을 구현하여 매개변수 업데이트를 안내한다.
  • 저해상도 및 고해상도 데이터를 다중해상도 프레임워크에서 결합하며, 해상도와 불확실성에 기반해 예측값을 가중하고 보정한다.

실험 결과

연구 질문

  • RQ1제한된 고해상도 데이터 조건에서 이중해상도 데이터를 활용한 전이학습이 신경망 대체 모델의 정확도를 상당히 향상시킬 수 있는가?
  • RQ2층별 미세조정 전략과 별도의 보정 네트워크를 훈련하는 방식 간에 정확도와 데이터 효율성 측면에서 성능는 어떻게 비교되는가?
  • RQ3가우시안 프로세스 모델이 불확실성 인식 학습률을 통해 매개변수 업데이트를 안내함으로써 신경망의 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 이중해상도 전이학습 전략은 예측 정확도를 유지하거나 향상시키면서도 고해상도 시뮬레이션 횟수를 얼마나 줄일 수 있는가?
  • RQ5이중해상도 가중치 학습 방법은 어떤 상황에서 표준 훈련 및 표준 전이학습을 능가하는가?

주요 결과

  • 고해상도 데이터가 극히 부족한 조건에서 표준 훈련에 비해 이중해상도 전이학습 접근법이 대체 모델 정확도를 상당히 향상시킨다.
  • 층별 미세조정 전략은 처음부터 훈련하는 것보다 더 높은 정확도를 달성하였으며, 테스트 사례에서 평균 제곱오차를 최대 60%까지 감소시켰다.
  • 가우시안 프로세스의 불확실성에 기반한 이중해상도 가중치 학습 방법은 수렴성과 강건성 면에서 뛰어난 성능을 보였으며, 특히 고차원 입력 공간에서 두드러졌다.
  • 작은 고해상도 데이터셋(예: 10~20개 샘플)과 풍부한 저해상도 데이터의 조합을 통해 고해상도 평가 횟수를 최소화하면서도 정확한 불확실성 전파가 가능했다.
  • 가우시안 프로세스 기반 학습률 적응이 일반화 능력을 향상시켜 과적합을 줄이고 분포 외 입력에 대한 성능을 향상시켰다.
  • 모든 세 개의 수치 예제에서 제안된 방법은 기준 방법에 비해 더 낮은 예측 오차와 더 나은 불확실성 캘리브레이션을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.