Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Training of Mean Variance Estimation Neural Networks

Laurens Sluijterman, Eric Cator|arXiv (Cornell University)|Feb 17, 2023
Fault Detection and Control Systems被引用数 4
ひとこと要約

本稿では、平均分散推定(MVE)ニューラルネットワークの訓練のための2つの重要な改善策を提案する:初期の平均のみの訓練中に分散を固定するウォームアップ段階、および平均と分散の予測に対する別々の正則化。著者らはUCIデータセットを用いた実験を通じて、これらの手法がモデルの安定性と性能を顕著に向上させることを示しており、特に等しい正則化と比較して、別々の正則化が顕著な向上をもたらすことがある。

ABSTRACT

This paper focusses on the optimal implementation of a Mean Variance Estimation network (MVE network) (Nix and Weigend, 1994). This type of network is often used as a building block for uncertainty estimation methods in a regression setting, for instance Concrete dropout (Gal et al., 2017) and Deep Ensembles (Lakshminarayanan et al., 2017). Specifically, an MVE network assumes that the data is produced from a normal distribution with a mean function and variance function. The MVE network outputs a mean and variance estimate and optimizes the network parameters by minimizing the negative loglikelihood. In our paper, we present two significant insights. Firstly, the convergence difficulties reported in recent work can be relatively easily prevented by following the simple yet often overlooked recommendation from the original authors that a warm-up period should be used. During this period, only the mean is optimized with a fixed variance. We demonstrate the effectiveness of this step through experimentation, highlighting that it should be standard practice. As a sidenote, we examine whether, after the warm-up, it is beneficial to fix the mean while optimizing the variance or to optimize both simultaneously. Here, we do not observe a substantial difference. Secondly, we introduce a novel improvement of the MVE network: separate regularization of the mean and the variance estimate. We demonstrate, both on toy examples and on a number of benchmark UCI regression data sets, that following the original recommendations and the novel separate regularization can lead to significant improvements.

研究の動機と目的

  • 回帰における不確実性推定において一般的な問題であるMVEネットワークの収束不安定性を解消すること。
  • NixとWeigend(1994)が提唱したウォームアップ期間の有効性を実験的に検証すること。
  • 平均と分散の予測に対する別々の正則化がモデル性能を向上させるかどうかを調査すること。
  • 実世界の回帰応用においてMVEネットワークを実用的かつ経験的根拠に基づいて訓練するための推奨事項を提示すること。

提案手法

  • 初期段階で分散を固定し、バイアス設定によって初期化された定数分散を用いて、平均ヘッドのみを訓練するウォームアップ段階を実装する。
  • 平均と分散の共同最適化中に勾配クリッピングを適用し、訓練の安定性を向上させる。
  • 平均および分散サブネットワークに対して別々のL2正則化係数を適用し、交差検証を用いて独立に最適化する。
  • MVEネットワークを負の対数尤度損失を用いて訓練する:$\mathcal{L}(\theta) = \sum_{i=1}^{N} \frac{1}{2}\log(\sigma^2_\theta(\bm{x}_i)) + \frac{1}{2}\frac{(y_i - \mu_\theta(\bm{x}_i))^2}{\sigma^2_\theta(\bm{x}_i)}$。
  • 分散出力を正の値に保つために、ソフトプラスまたは指数変換を適用する。
  • 複数のランダムシードおよび5〜10分割交差検証を用いて、UCI回帰ベンチマークでRMSEおよび対数尤度指標に基づき性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1NixとWeigend(1994)が提唱したオリジナルのウォームアップ推奨に従うことで、MVEネットワークの訓練における収束問題が解消されるか?
  • RQ2ウォームアップ後に平均と分散を同時に最適化することは性能向上に寄与するか、それとも分散の訓練中に平均を固定する方が好ましいか?
  • RQ3平均および分散サブネットワークに別々の正則化係数を適用することで、共有正則化と比較して予測性能が向上するか?
  • RQ4異なる回帰データセットにおいて、平均および分散の最適な正則化強度はどのように比較されるか?

主な発見

  • 分散を固定し、初期段階で平均のみを訓練するウォームアップ期間を設けることで、訓練の安定性が顕著に向上し、ネットワークが初期段階ですぐに高パフォーマンスを示す領域に集中するのを防げる。
  • ウォームアップを実施しない場合、MVEネットワークは適合が悪い領域で学習がうまくいかず、結果としてRMSEおよび対数尤度スコアが最適でなくなる傾向がある。
  • 平均および分散サブネットワークに別々の正則化を適用することで、複数のUCIデータセットで一貫して性能向上が見られ、特に分散の正則化強度は平均のそれよりも1桁大きい値を要することが一般的である。
  • エネルギーおよびヨットのデータセットでは、別々の正則化が等しい正則化よりも顕著に優れた結果をもたらし、最適な正則化定数が似通っていてもその差が顕著に現れる。
  • ウォームアップ後に平均を固定するか、平均と分散を同時に最適化するかの差は、本質的に大きくはなかったが、別々の正則化が使われない場合には、同時に最適化する方がわずかに効果的であった。
  • ボストン・ハービングの例のように問題が比較的単純なケースでは、すべての戦略が同程度の性能を示しており、ウォームアップおよび別々の正則化が、特に複雑またはノイズの多い回帰タスクにおいて最も効果的であることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。