Skip to main content
QUICK REVIEW

[論文レビュー] Let's Agree to Agree: Neural Networks Share Classification Order on Real Datasets

Guy Hacohen, Leshem Choshen|arXiv (Cornell University)|May 26, 2019
Machine Learning and Data Classification被引用数 6
ひとこと要約

この論文は、CIFAR-100 や ImageNet などの実世界のデータセット上で、異なるアーキテクチャや学習ランにわたって、深層ニューラルネットワークが一貫して同じ順序で例を学習することを示している。主な発見は、この共有学習順序が訓練のダイナミクスではなく、データセットの構造に起因することである。合成データやシャッフルラベルデータセットではこのパターンが崩れ、AdaBoost などの非ニューラルモデルは異なる順序で学習する。

ABSTRACT

We report a series of robust empirical observations, demonstrating that deep Neural Networks learn the examples in both the training and test sets in a similar order. This phenomenon is observed in all the commonly used benchmarks we evaluated, including many image classification benchmarks, and one text classification benchmark. While this phenomenon is strongest for models of the same architecture, it also crosses architectural boundaries -- models of different architectures start by learning the same examples, after which the more powerful model may continue to learn additional examples. We further show that this pattern of results reflects the interplay between the way neural networks learn benchmark datasets. Thus, when fixing the architecture, we show synthetic datasets where this pattern ceases to exist. When fixing the dataset, we show that other learning paradigms may learn the data in a different order. We hypothesize that our results reflect how neural networks discover structure in natural datasets.

研究の動機と目的

  • 異なるモデルや学習ランにわたって、ニューラルネットワークが例を一貫した順序で学習するかどうかを調査すること。
  • この一貫した学習順序が最適化ダイナミクス(例:SGD)に起因するのか、それともデータセットの固有構造に起因するのかを特定すること。
  • ニューラルネットワークに特有のものかどうかを、非ニューラル学習パラダイムと比較することで検証すること。
  • 学習順序がデータの複雑さと相関しているかどうかを評価すること。

提案手法

  • CIFAR-100、MNIST、ImageNet などの標準ベンチマークで訓練された、同じおよび異なるアーキテクチャの複数のニューラルネットワークモデル間で、分類順序を実証的に比較する。
  • 「分類順序」を、各テスト例がモデルによって初めて正しく分類されたエポックとして定義する。
  • ピアソン相関を用いた相関分析により、モデル間、およびニューラルモデルと非ニューラルモデル間の学習順序を比較する。
  • 最適化手法、学習率、ランダムシードを変更してモデルを訓練し、学習順序が訓練ハイパーパrameterに依存するかどうかをテストする。
  • 内在的な構造を持たない合成データセットを構築し、学習順序が継続するかどうかをテストする。
  • 事前学習済みの Inception-V3 モデルからの特徴量と、ピクセルそのものに対して、線形弱学習器を用いた AdaBoost を訓練し、ニューラルネットワークと学習順序を比較する。

実験結果

リサーチクエスチョン

  • RQ1同じベンチマークデータセット上で訓練された、異なるアーキテクチャや学習ハイパーパrameterを持つニューラルネットワークモデルは、例を同じ順序で学習するか?
  • RQ2観察された学習順序は、確率的最適化(例:SGD)に起因するのか、それともデータセットの潜在的構造の性質に起因するのか?
  • RQ3一般化信号のない合成データセットやシャッフルラベルデータセットで学習した場合、この学習順序は維持されるか?
  • RQ4AdaBoost に線形分類器を用いた非ニューラル学習モデルは、ニューラルネットワークと同様に同じ例を同じ順序で学習するか?
  • RQ5学習順序は、データの複雑さと相関しており、より簡単な例がすべてのモデルでより早く学習されるのか?

主な発見

  • 同じアーキテクチャのモデル同士は、複数のベンチマークでピアソン相関係数が 0.9 以上の高い相関を示して、例を類似した順序で学習する。
  • 異なるアーキテクチャのモデルでも、初期段階では同じ順序で例を学習するが、より強力なモデルは、弱いモデルが共有セットを学習した後にのみ追加の例を学習する。
  • 自然な構造を持たない合成データセットでは、共有学習順序が崩れるため、これは SGD や最適化のアーティファクトではなく、データセット構造に起因することが示唆される。
  • 一般化が不可能なシャッフルラベルデータセットでは、モデルは異なる順序で例を記憶するため、このパターンは実際のデータセット構造に依存していることが示される。
  • 線形分類器を用いた AdaBoost は、事前学習済みネットワークの特徴量を使っても、ニューラルネットワークとは著しく異なる順序で例を学習し、相関係数が低く(r = 0.35)なる。
  • 同じデータ分布から抽出された訓練セットであれば、異なる訓練セットで学習しても、学習順序は一貫して維持される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。