[論文レビュー] On transfer learning of neural networks using bi-fidelity data for uncertainty propagation
本稿では、計算的に高価な工学的システムにおける不確実性伝播のためのニューラルネットワークを訓練するために、低精度および高精度のシミュレーションデータを組み合わせる二精度転移学習フレームワークを提案する。ガウス過程回帰を用いて、修正された確率的勾配降下法によるパラメータ更新を誘導することで、標準的な訓練に比べて高精度の予測が得られ、高精度評価回数を減らすことが可能となり、3つのテストケースにおいてもサロゲートモデルの性能が顕著に向上することを示している。
Due to their high degree of expressiveness, neural networks have recently been used as surrogate models for mapping inputs of an engineering system to outputs of interest. Once trained, neural networks are computationally inexpensive to evaluate and remove the need for repeated evaluations of computationally expensive models in uncertainty quantification applications. However, given the highly parameterized construction of neural networks, especially deep neural networks, accurate training often requires large amounts of simulation data that may not be available in the case of computationally expensive systems. In this paper, to alleviate this issue for uncertainty propagation, we explore the application of transfer learning techniques using training data generated from both high- and low-fidelity models. We explore two strategies for coupling these two datasets during the training procedure, namely, the standard transfer learning and the bi-fidelity weighted learning. In the former approach, a neural network model mapping the inputs to the outputs of interest is trained based on the low-fidelity data. The high-fidelity data is then used to adapt the parameters of the upper layer(s) of the low-fidelity network, or train a simpler neural network to map the output of the low-fidelity network to that of the high-fidelity model. In the latter approach, the entire low-fidelity network parameters are updated using data generated via a Gaussian process model trained with a small high-fidelity dataset. The parameter updates are performed via a variant of stochastic gradient descent with learning rates given by the Gaussian process model. Using three numerical examples, we illustrate the utility of these bi-fidelity transfer learning methods where we focus on accuracy improvement achieved by transfer learning over standard training approaches.
研究の動機と目的
- 科学的計算における不確実性伝播のためのニューラルネットワークを訓練する際の高精度シミュレーションデータの制限という課題に対処すること。
- 転移学習を用いて低精度および高精度データを統合することで、正確なサロゲートモデルの訓練にかかる計算コストを低減すること。
- 低精度および高精度出力の差異をモデル化するガウス過程を用いることで、モデルの精度と一般化性能を向上させること。
- 2つの転移学習戦略(層ごとの微調整およびGPの不確実性で情報を得た勾配更新に基づく二精度重み付き学習)を評価すること。
- 提案手法の有効性を、複雑さとデータ不足の程度が異なる3つの工学的問題に対して検証すること。
提案手法
- システムの一般的な入出力行動を捉えるために、低精度データに基づいてニューラルネットワークを訓練し、ベースモデルとする。
- 高精度データを用いて低精度ネットワークの上位層のみを微調整することで、転移学習を適用し、より高い精度に適応させる。
- あるいは、小規模な高精度データセットを用いて、低精度予測を高精度出力にマップする別個の浅いネットワークを訓練する。
- 低精度および高精度出力の差異を推定するためにガウス過程モデルを用い、不確実性を考慮した補正を提供する。
- ガウス過程の予測分散に基づいて学習率を動的に調整する、確率的勾配降下法の変種を実装し、パラメータ更新を誘導する。
- 低精度および高精度データを統合したマルチファシリティフレームワークを構築し、ガウス過程を用いて忠実度と不確実性に基づいて予測を重み付け・補正する。
実験結果
リサーチクエスチョン
- RQ1限られた高精度データのもとで、二精度データを用いた転移学習が、不確実性評価におけるニューラルネットワークサロゲートの精度を顕著に向上させることができるか?
- RQ2層ごとの微調整戦略と別個の補正ネットワークを訓練する戦略とを比較した場合、精度およびデータ効率の面でどちらが優れているか?
- RQ3ガウス過程モデルが、不確実性を考慮した学習率を用いたパラメータ更新によって、ニューラルネットワークの一般化性能をどの程度向上させられるか?
- RQ4提案された二精度転移学習戦略は、予測精度を維持または向上させながら、高精度シミュレーションの必要回数をどの程度削減できるか?
- RQ5どのような状況下で、二精度重み付き学習アプローチが標準的な訓練および標準的な転移学習を上回るか?
主な発見
- 高精度データが限られている状況においても、二精度転移学習アプローチは標準的な訓練に比べてサロゲートモデルの精度を顕著に向上させた。
- 層ごとの微調整戦略は、初期学習から直接学習するよりも高い精度を達成し、テスト例では平均二乗誤差を最大60%まで削減した。
- ガウス過程の不確実性で情報を得た二精度重み付き学習法は、特に高次元入力空間において優れた収束性とロバストネスを示した。
- 少量の高精度データセット(例:10〜20サンプル)と豊富な低精度データの組み合わせにより、高精度評価回数を最小限に抑えつつ、正確な不確実性伝播が可能になった。
- ガウス過程に基づく学習率の適応は、一般化性能を向上させ、過学習を低減し、分布外入力に対する性能を向上させた。
- 3つの数値的例すべてにおいて、提案手法はベースライン手法に比べて予測誤差が低く、不確実性のキャリブレーションが良好であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。