Skip to main content
QUICK REVIEW

[論文レビュー] Towards Task and Architecture-Independent Generalization Gap Predictors

Scott Yak, Javier Gonzalvo|arXiv (Cornell University)|Jun 4, 2019
Advanced Neural Network Applications参考文献 10被引用数 9
ひとこと要約

本論文は、深層ニューラルネットワーク(DNN)および再帰ニューラルネットワーク(RNN)を用いて、タスクおよびアーキテクチャに依存しない一般化ギャップ予測器を提案する。13,500個の異なるアーキテクチャ、ハイパーパramータ、スパイラルデータセットのバリエーションを持つニューラルネットワークを学習させることで、一般化ギャップの予測においてR² = 0.965を達成し、線形モデルを著しく上回り、未学習のハイパーパramータおよびデータセットに対しても強いゼロショット一般化を示す。

ABSTRACT

Can we use deep learning to predict when deep learning works? Our results suggest the affirmative. We created a dataset by training 13,500 neural networks with different architectures, on different variations of spiral datasets, and using different optimization parameters. We used this dataset to train task-independent and architecture-independent generalization gap predictors for those neural networks. We extend Jiang et al. (2018) to also use DNNs and RNNs and show that they outperform the linear model, obtaining $R^2=0.965$. We also show results for architecture-independent, task-independent, and out-of-distribution generalization gap prediction tasks. Both DNNs and RNNs consistently and significantly outperform linear models, with RNNs obtaining $R^2=0.584$.

研究の動機と目的

  • 特定のタスクおよびニューラルネットワークアーキテクチャに依存しない一般化ギャップ予測器の開発を目的とする。
  • 従来の研究では固定されたアーキテクチャおよびデータセット内でのみ一般化可能であったという限界を克服することを目的とする。
  • 未学習のアーキテクチャ、ハイパーパramータ、データ分布における一般化性能のゼロショット予測を可能とすることを目的とする。
  • ニューラルアーキテクチャサーチ(NAS)の向上を図り、ホールドアウト検証セットへの依存を低減することを目的とする。
  • ディープラーニング自体がどれだけ一般化するかを予測するために、ディープラーニングが有効であるかを検証することを目的とする。

提案手法

  • 27種類のスパイラルデータセットのバリエーション、多様なアーキテクチャ、最適化ハイパーパラメータを用いて13,500個のニューラルネットワークを学習する。
  • 一般化ギャップ予測の入力特徴として、レイヤーごとのマージンシグネチャーを抽出する。
  • 可変深度のネットワークに対応するため、レイヤー固有の特徴を合算して固定次元のベクトルを生成する。
  • 固定入力サイズを必要とせず、可変長のレイヤー特徴のシーケンスを自然に処理できるRNNを採用する。
  • マージン特徴を入力としてDNNおよびRNNモデルを学習させ、一般化ギャップ(訓練精度とテスト精度の差)を予測する。
  • 同じ分布および分布外の設定で評価を行い、未学習のハイパーパラメータおよびデータセットへの外挿も含む。

実験結果

リサーチクエスチョン

  • RQ1特定のタスクおよびニューラルネットワークアーキテクチャに依存しない一般化ギャップ予測器を学習可能か?
  • RQ2DNNおよびRNNといったディープラーニングモデルは、多様なアーキテクチャおよびデータセットにおいて、線形モデルを上回って一般化ギャップを予測できるか?
  • RQ3これらの予測器は、未学習のハイパーパラメータおよびデータ分布に対してもどれほど一般化できるか?
  • RQ4RNNは、レイヤー特徴のシーケンスを処理することで、可変深度のニューラルネットワークを効果的にモデル化できるか?
  • RQ5モデルは、ハイパーパラメータ固有の相関関係を超えて、一般化可能なパターンを学習しているか?

主な発見

  • DNNベースの一般化ギャップ予測器は、データセット依存の同じ分布設定下でR² = 0.965を達成し、線形モデル(R² = 0.956)を上回り、Jiangら(2018)の結果を再現した。
  • RNNベースの予測器は、データセット非依存の同じ分布設定下でR² = 0.584を達成し、線形モデル(R² = 0.390)およびDNN(R² = 0.502)を著しく上回った。
  • 分布外評価(未学習のハイパーパラメータおよびデータセットでテスト)においても、DNNおよびRNNモデルは性能低下が僅か(≤0.002 R²の低下)に抑えられ、強固な一般化を示した。
  • 未学習のアーキテクチャおよびハイパーパラメータに対しても良好な一般化を示しており、特定の設定に過学習しているのではなく、一般化可能なパターンを学習していると示唆された。
  • RNNの使用により、アーキテクチャ的制約なしに可変深度のネットワークを効果的にモデル化でき、シーケンスベースのモデリングがディープラーニングの一般化予測に実現可能であることを示した。
  • 結果から、ディープラーニングを用いてディープラーニングの一般化を予測できる可能性が示され、ホールドアウトセットなしのNASやモデル選択への応用が期待できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。