Skip to main content
QUICK REVIEW

[論文レビュー] Small Data, Big Decisions: Model Selection in the Small-Data Regime

Jörg Bornschein, Francesco Visin|arXiv (Cornell University)|Sep 26, 2020
Neural Networks and Applications被引用数 10
ひとこと要約

この論文は、過パラメータ化されたニューラルネットワークにおける一般化性能が訓練データサイズにどのように依存するかを調査し、特に小さなデータセットでは、アーキテクチャ間での性能順位が安定するため、より信頼できるモデル選択が可能であることを示している。温度補正を導入して交差エントロピー指標を安定化させることで、小規模データにおける最小記述長(MDL)の推定が可能となり、原理的でオッカムの剃刀に配慮したモデル選択が可能になる。

ABSTRACT

Highly overparametrized neural networks can display curiously strong generalization performance - a phenomenon that has recently garnered a wealth of theoretical and empirical research in order to better understand it. In contrast to most previous work, which typically considers the performance as a function of the model size, in this paper we empirically study the generalization performance as the size of the training set varies over multiple orders of magnitude. These systematic experiments lead to some interesting and potentially very useful observations; perhaps most notably that training on smaller subsets of the data can lead to more reliable model selection decisions whilst simultaneously enjoying smaller computational costs. Our experiments furthermore allow us to estimate Minimum Description Lengths for common datasets given modern neural network architectures, thereby paving the way for principled model selection taking into account Occams-razor.

研究の動機と目的

  • 過パラメータ化されたニューラルネットワークの一般化性能が、特に小さなデータの状況において、訓練データサイズにどのように変化するかを理解すること。
  • 特に補間閾値を超えた領域においても、異なる訓練データサイズ間でモデル性能順位が一貫しているかどうかを調査すること。
  • モデルの一般化指標を安定化させるために、ニューラルネットワークの出力を補正することで、最小記述長(MDL)を原理的かつ一貫して推定し、モデル選択を可能にすること。
  • 計算コストを削減し、モデル選択およびニューラルアーキテクチャ探索を効率化するために、完全なデータセットよりも小さなデータサブセットがより頑健な性能信号を提供することを示すこと。

提案手法

  • ImageNet、CIFAR10、MNIST、EMNISTのサブセットに対して、ResNets、VGG、MLPsなど多様なディープラーニングアーキテクチャを、完全データからクラスあたり数例にまで訓練データサイズを変化させながら体系的に訓練する。
  • ソフトマックス出力に温度スケーリングを適用してモデルの確率を補正し、未補正の交差エントロピーを安定的で良好な振る舞いを示す一般化指標に変換する。
  • 事前順序(前向き時系列)コーディングフレームワークを用い、訓練データサイズに沿って補正済み交差エントロピーを統合することで、ディープラーニングモデルの最小記述長(MDL)を推定する。
  • 性能曲線の台形積分を用いて、モデルペア間のMDL対数尤度差を計算し、複数のランダムシードと異なる区間点を用いて不確実性を推定する。
  • 訓練データサブセットがネスト構造(つまり、大きなセットが小さいセットを含む)であることを保証することで、事前順序MDL推定プロセスの整合性を維持する。
  • 一般化誤差と補正済み交差エントロピーを複数のアーキテクチャと最適化設定で比較することで、性能順位の頑健性を検証する。

実験結果

リサーチクエスチョン

  • RQ1過パラメータ化されたニューラルネットワークの相対的な一般化性能順位は、小さなデータセットと大きなデータセットの両方で安定しているか?
  • RQ2温度補正により、特に過学習領域においても、さまざまなモデルサイズと訓練データサイズの下で一般化交差エントロピー指標が安定化するか?
  • RQ3補正済み予測と小さな訓練サブセットを用いて、ディープニューラルネットワークの信頼性のある最小記述長(MDL)推定が可能か?
  • RQ4完全なデータセットよりも小さなデータサブセットで訓練することで、性能信号のノイズと分散が低減され、モデル選択により頑健で信頼性の高い信号が得られるか?
  • RQ5補正済み性能曲線に基づくMDLによるモデル選択は、ヒューリスティックなアーキテクチャ探索に代わる原理的で、オッカムの剃刀を尊重する代替手段を提供できるか?

主な発見

  • 過パラメータ化されたモデルは、クラスあたり10例程度のデータでさえも、訓練データサイズにかかわらず、一般化性能の相対的順位を維持する。これは、小さなデータにおけるモデル選択の強力な経験的仮説を支持する。
  • 温度補正により、未補正の一般化交差エントロピーは安定的で良好な振る舞いを示す指標に変換され、極端な過学習下でも実際の一般化誤差と強く相関する。
  • 訓練データサイズを横軸にとった補正済み性能曲線の下側面積は、最小記述長(MDL)の信頼性の高い推定値を提供し、オッカムの剃刀を考慮した原理的なモデル選択を可能にする。
  • クラスあたり10~100例程度の小さなデータサブセットで訓練することで、完全なデータセットよりもノイズと分散が低減され、モデル選択により頑健で信頼性の高い意思決定が得られる。
  • CIFAR10およびImageNetにおけるMDL対数尤度差の推定は一貫しており、不確実性が低く(例:20k nats未満)、ImageNetではResNet-101がResNet-50よりも87k natsの短い記述長を示した。
  • ネストされた訓練データサブセットと補正済み交差エントロピーを用いたMDLの計算により、完全なデータの訓練を必要とせず、効率的でスケーラブルかつ理論的に根拠のあるモデル選択が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。