Skip to main content
QUICK REVIEW

[論文レビュー] Towards Learning Convolutions from Scratch

Behnam Neyshabur|arXiv (Cornell University)|Jul 27, 2020
Domain Adaptation and Few-Shot Learning参考文献 40被引用数 11
ひとこと要約

この論文は、最小記述長(MDL)を指針とする手法として、完全結合層が、初期化から局所的でスパースな畳み込み型接続パターンを学習できる新しい正則化法 \beta-lasso を提案する。\beta-lasso で訓練された完全結合ネットワークは、重み共有や局所的結合といったインダクティブバイアスを用いず、CIFAR-10(85.19%)、CIFAR-100(59.56%)、SVHN(94.07%)で最先端の精度を達成し、標準的な畳み込みネットワークとの性能差を効果的に埋め合わせた。

ABSTRACT

Convolution is one of the most essential components of architectures used in computer vision. As machine learning moves towards reducing the expert bias and learning it from data, a natural next step seems to be learning convolution-like structures from scratch. This, however, has proven elusive. For example, current state-of-the-art architecture search algorithms use convolution as one of the existing modules rather than learning it from data. In an attempt to understand the inductive bias that gives rise to convolutions, we investigate minimum description length as a guiding principle and show that in some settings, it can indeed be indicative of the performance of architectures. To find architectures with small description length, we propose $β$-LASSO, a simple variant of LASSO algorithm that, when applied on fully-connected networks for image classification tasks, learns architectures with local connections and achieves state-of-the-art accuracies for training fully-connected nets on CIFAR-10 (85.19%), CIFAR-100 (59.56%) and SVHN (94.07%) bridging the gap between fully-connected and convolutional nets.

研究の動機と目的

  • 畳み込みのインダクティブバイアス(特に局所的結合と重み共有)が、アーキテクチャに組み込まれるのではなく、データから学習可能かどうかを調査すること。
  • 最小記述長(MDL)理論を用いて、コアな構造的バイアスを発見することで、深層学習におけるエキスパート設計のインダクティブバイアスを低減すること。
  • 完全結合ネットワークと畳み込みネットワークの性能差を、完全結合アーキテクチャが畳み込みに類似した構造を自律的に学習することで埋め合わせること。
  • アーキテクチャの構造(例:接続パターン)をデータから学ぶ方法を開発し、効率的で局所的かつスパースな表現の自動発見を可能にすること。

提案手法

  • 完全結合層の重みにスパarsityを促進するとともに、局所的結合パターンを維持するためのラッソ正則化の変種として、\beta-lasso を提案する。
  • 構造的アーキテクチャの学習を支援する理論的枠組みとして、最小記述長(MDL)を用い、記述が短いモデルを好む。
  • 画像分類タスクにおける完全結合ネットワークの学習中に \beta-lasso を適用し、畳み込みのインダクティブバイアスを明示的に導入せずに、スパースで局所的結合なフィルタを学習可能にする。
  • 学習済みネットワークを標準的な畳み込みネットワークおよび局所的結合ベースラインと比較し、学習されたフィルタのスパarsityおよび構造的類似度を評価する。
  • 非ゼロパラメータ数およびフィルタパターンのレイヤごとの分析を用いて、\beta-lasso が局所的結合または畳み込み構造に類似したアーキテクチャを学習していることを検証する。
  • \beta-lasso を、異なるカーネルサイズを有するResNet18に拡張し、最適なカーネル構造を自動で学習できる適応性を示している。

実験結果

リサーチクエスチョン

  • RQ1畳み込みに類似したインダクティブバイアス(局所的結合や重み共有など)が、アーキテクチャにハードコードされるのではなく、データから学習可能か?
  • RQ2最小記述長(MDL)は、画像認識における効率的でスパースかつ局所的な構造的パターンを発見する有効なインダクティブバイアスとして機能するか?
  • RQ3\beta-lasso で訓練された完全結合ネットワークは、畳み込み構造へのアーキテクチャ的バイアスが一切ない状態で、畳み込みネットワークと同等の性能を達成可能か?
  • RQ4\beta-lasso が学習するフィルタ構造は、標準的な畳み込みネットワークおよび局所的結合ネットワークと比較して、スパarsityおよび局所性の点でどのように異なるか?
  • RQ5\beta-lasso は、より深いアーキテクチャおよび異なるカーネルサイズに一般化可能であり、最適な構造的パターンを自動で学習可能か?

主な発見

  • \beta-lasso の手法により、完全結合ネットワークが、明示的なインダクティブバイアスがなくとも、局所的でスパースなフィルタパターンを、局所的結合および畳み込みネットワークと類似した形で学習可能であることが示された。
  • CIFAR-10では、\beta-lasso で訓練された完全結合ネットワークがトップ-1精度85.19%を達成し、従来の完全結合ベースラインを上回り、標準的な畳み込みネットワークの性能に近づいた。
  • CIFAR-100では、59.56%の精度を達成し、以前の完全結合アプローチを著しく上回り、畳み込みモデルとの差を縮めた。
  • SVHNでは、94.07%の精度を達成し、アーキテクチャ的バイアスなしに多様な画像データセットに強く一般化できることを示した。
  • \beta-lasso が学習するフィルタはスパースで局所的結合となっており、局所的な画像ネighborhoodのスパースサンプリングに類似したパターンを示しており、局所性の効果的な発見がなされている。
  • \beta-lasso で訓練されたネットワークの最終層は依然として密集しているが、初期層は徐々にスパース化しており、階層的な構造的パターンの学習が行われていることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。