Skip to main content
QUICK REVIEW

[論文レビュー] Discovering Neural Wirings

Mitchell Wortsman, Ali Farhadi|arXiv (Cornell University)|Jan 1, 2019
Advanced Neural Network Applications被引用数 36
ひとこと要約

本論文は、チャネルが独立して接続を形成できるようにすることで、ニューラルネットワーク内のスパースでダイナミックな接続パターンを学習する Deep Neural Wiring (DNW) を提案する。構造と重みのエンドツーエンド学習が可能であり、MobileNetV1 よりも 10% 高い ImageNet の精度を達成し、約 41M FLOPs で実現する。手動設計やランダム接続のネットワークを上回り、再帰的および連続時間ネットワークにも一般化可能である。

ABSTRACT

The success of neural networks has driven a shift in focus from feature engineering to architecture engineering. However, successful networks today are constructed using a small and manually defined set of building blocks. Even in methods of neural architecture search (NAS) the network connectivity patterns are largely constrained. In this work we propose a method for discovering neural wirings. We relax the typical notion of layers and instead enable channels to form connections independent of each other. This allows for a much larger space of possible networks. The wiring of our network is not fixed during training -- as we learn the network parameters we also learn the structure itself. Our experiments demonstrate that our learned connectivity outperforms hand engineered and randomly wired networks. By learning the connectivity of MobileNetV1we boost the ImageNet accuracy by 10% at ~41M FLOPs. Moreover, we show that our method generalizes to recurrent and continuous time networks. Our work may also be regarded as unifying core aspects of the neural architecture search problem with sparse neural network learning. As NAS becomes more fine grained, finding a good architecture is akin to finding a sparse subnetwork of the complete graph. Accordingly, DNW provides an effective mechanism for discovering sparse subnetworks of predefined architectures in a single training run. Though we only ever use a small percentage of the weights during the forward pass, we still play the so-called initialization lottery with a combinatorial number of subnetworks. Code and pretrained models are available at https://github.com/allenai/dnw while additional visualizations may be found at https://mitchellnw.github.io/blog/2019/dnw/.

研究の動機と目的

  • ニューラルネットワークにおける固定されたアーキテクチャ的ブロックの制限を克服し、動的で学習可能な接続性を可能にすること。
  • ニューロンアーキテクチャ探索 (NAS) の制限された探索空間を緩和し、レイヤーベースの制約を解除し、任意のチャネル間接続を可能にすること。
  • スパースニューラルネットワーク学習とニューロンアーキテクチャ探索を統合し、一度の学習ランで高性能なサブネットワークを発見すること。
  • 接続パターンを学習することで、手動設計やランダム接続のアーキテクチャよりも優れた性能が得られることを示すこと。
  • フィードフォワードモデルにとどまらず、再帰的および連続時間ネットワークへの適用可能性を拡張すること。

提案手法

  • 従来のレイヤーの代わりに、各チャネルが他の任意のチャネルに接続できる柔軟なワイヤリング機構を導入し、潜在的な接続の完全グラフを形成する。
  • 接続性は微分可能であり、微分可能なアーキテクチャ探索手法を用いて、ネットワーク重みと同時に学習される。
  • 推論時にはスパースルーティング機構を用いて、接続のわずかなサブセットのみを選択し、FLOPs を削減しながら性能を維持する。
  • アーキテクチャはエンドツーエンドで訓練され、重みと接続パターンの両方が同時に最適化可能である。
  • アーキテクチャ探索を組み合わせ的ロトゥリーとみなす。初期化ロトゥリーは、膨大な数のスパースサブネットワークの上に実施される。
  • 再帰的および連続時間ネットワークへの一般化は、ワイヤリング機構を逐次的および時間的計算に適応させることで実現する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークの接続性は、アーキテクチャ設計によって固定されるのではなく、エンドツーエンドで学習可能か?
  • RQ2スパースでダイナミックなワイヤリングを学習することで、手動設計やランダム接続のネットワークよりも優れた性能が得られるか?
  • RQ3一度の学習ランで、完全グラフアーキテクチャから高性能なスパースサブネットワークを発見できるか?
  • RQ4ImageNet における学習済みワイヤリングの性能は、MobileNetV1 などの標準アーキテクチャと比べてどうか?
  • RQ5この手法は、再帰的および連続時間ニューラルネットワークへ拡張可能か?

主な発見

  • 提案手法は、約 41M FLOPs の消費で MobileNetV1 よりも ImageNet のトップ-1 精度を 10% 向上させる。
  • 学習済みの接続パターンは、複数のベンチマークで手動設計およびランダム接続ネットワークを上回る性能を示す。
  • 一度の学習ランで完全グラフアーキテクチャから高性能なスパースサブネットワークを発見でき、組み合わせ的アーキテクチャ探索問題を効果的に解決する。
  • アプローチは再帰的および連続時間ネットワークへ一般化可能であり、フィードフォワードモデルを超えた広範な適用可能性を示している。
  • 推論時にはわずかな重みの割合しか使用しないものの、組み合わせ的数のスパースサブネットワークに対する初期化ロトゥリーの一種を実現している。
  • コードと事前学習済みモデルは公開されており、スパースアーキテクチャ発見分野における再現性とさらなる研究を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。