Skip to main content
QUICK REVIEW

[論文レビュー] Avoiding overfitting of multilayer perceptrons by training derivatives

Vsevolod I. Avrutskiy|arXiv (Cornell University)|Feb 28, 2018
Neural Networks and Applications参考文献 19被引用数 3
ひとこと要約

本稿では、4次までの目的関数の導関数を用いて多層パーセプトロンを学習する拡張された誤差逆伝播法を提案する。この手法により、過学習が顕著に低減され、大規模なネットワークでも、古典的な誤差逆伝播法の2×10⁴と比較して、テスト対訓練コスト比が1.5にまで低下する。

ABSTRACT

Resistance to overfitting is observed for neural networks trained with extended backpropagation algorithm. In addition to target values, its cost function uses derivatives of those up to the $4^{\mathrm{th}}$ order. For common applications of neural networks, high order derivatives are not readily available, so simpler cases are considered: training network to approximate analytical function inside 2D and 5D domains and solving Poisson equation inside a 2D circle. For function approximation, the cost is a sum of squared differences between output and target as well as their derivatives with respect to the input. Differential equations are usually solved by putting a multilayer perceptron in place of unknown function and training its weights, so that equation holds within some margin of error. Commonly used cost is the equation's residual squared. Added terms are squared derivatives of said residual with respect to the independent variables. To investigate overfitting, the cost is minimized for points of regular grids with various spacing, and its root mean is compared with its value on much denser test set. Fully connected perceptrons with six hidden layers and $2\cdot10^{4}$, $1\cdot10^{6}$ and $5\cdot10^{6}$ weights in total are trained with Rprop until cost changes by less than 10% for last 1000 epochs, or when the $10000^{\mathrm{th}}$ epoch is reached. Training the network with $5\cdot10^{6}$ weights to represent simple 2D function using 10 points with 8 extra derivatives in each produces cost test to train ratio of $1.5$, whereas for classical backpropagation in comparable conditions this ratio is $2\cdot10^{4}$.

研究の動機と目的

  • 多層パーセプトロンにおける過学習を解消するために、学習プロセスに高次導関数を組み込むこと。
  • 特にスパースな訓練データにおいて、導関数の学習が古典的な誤差逆伝播法を上回る一般化性能をもたらすかどうかを調査すること。
  • ネットワーク容量(最大5×10⁶の重み)が、導関数を含めた場合の過学習に与える影響を評価すること。
  • 2次元および5次元の関数近似、および2次元のポアソン方程式の解法における性能を比較し、導関数を含めた学習の有効性を検証すること。

提案手法

  • コスト関数を拡張し、ネットワーク出力と目的関数との間の二乗誤差に加え、入力に関する4次までの導関数の二乗誤差も含める。
  • 1000エポックの間のコスト変化が10%未満に収束するか、10,000エポックに達するまでRprop最適化を実行する。
  • 入力グリッドの間隔を変化させた規則的なグリッドを用いて、2次元および5次元の関数近似、2次元のポアソン方程式の解法に本手法を適用する。
  • 密度の高いテストセットと粗い訓練グリッドとの間で、コストの平均二乗根を計算し、テストセットと訓練セットの性能を比較する。
  • 解析的導関数が得られない場合には、特に1次導関数に対して、有限差分ステンシルを用いて導関数を組み込む。
  • テストコストの平均と訓練コストの平均の比を用いて過学習を評価し、比が低いほど一般化性能が優れていると判断する。

実験結果

リサーチクエスチョン

  • RQ1目的関数の高次導関数を学習させることで、多層パーセプトロンにおける過学習を低減できるか?
  • RQ24次までの導関数を含めた学習が、古典的な誤差逆伝播法と比較してテスト対訓練コスト比に与える影響は何か?
  • RQ3ネットワークサイズが増大(最大5×10⁶パラメータ)し、訓練データがスパースになるに従い、導関数学習の利点は減少するか、それとも持続するか?
  • RQ4導関数同士の相乗効果が、関数近似およびPDEの解法タスクにおける一般化性能にどの程度寄与するか?
  • RQ5導関数を含めた場合、入力次元(2次元対5次元)および問題タイプ(関数近似対PDEの解法)に応じて、過学習比はどのように変化するか?

主な発見

  • 10個の訓練点と1点あたり8つの導関数項を有する2次元関数近似において、テスト対訓練コスト比は1.5であった。これは古典的誤差逆伝播法の2×10⁴と比較して顕著な改善である。
  • 5×10⁶の重みを持つネットワークにおいても、2次元ポアソン方程式の解法において11個の訓練点しか存在しない状況でも、過学習比は1.03未満(対数で0.03未満)を維持した。
  • 学習対象とする導関数の最大次数が上昇するにつれて、テスト対訓練コスト比は顕著に低下し、高次導関数の学習が一般化性能を向上させることを示した。
  • 極めてスパースな訓練グリッド(例:2次元で11点)であっても、導関数を含めた学習により、テスト精度と訓練精度の差が8%以内に収まった。
  • 2×10⁴から5×10⁶の重みにわたる全テストされたネットワークサイズにおいて、過学習が低く抑えられ、モデル容量の変化に対してもロバストであることが示された。
  • 観察された過学習の低減は、高次近似と導関数同士の相乗効果の両方によるものであり、低次項の精度向上に寄与していると考察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。