Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Linear Networks with a Fixed Butterfly Structure: Theory and Practice

Nir Ailon, Omer Leibovich|arXiv (Cornell University)|Jul 17, 2020
Face and Expression Recognition参考文献 41被引用数 5
ひとこと要約

この論文では、深層ニューラルネットワークにおける全結合層を、パrameter数を二次関数的からほぼ線形にまで削減する構造的でスパースなバタフライネットワークアーキテクチャに置き換える手法を提案している。実験的結果では、トレーニングと推論が高速化され、理論的分析により、追加の深さが加わっても最適化の安定性が保たれていることが確認された。

ABSTRACT

A butterfly network consists of logarithmically many layers, each with a linear number of non-zero weights (pre-specified). The fast Johnson-Lindenstrauss transform (FJLT) can be represented as a butterfly network followed by a projection onto a random subset of the coordinates. Moreover, a random matrix based on FJLT with high probability approximates the action of any matrix on a vector. Motivated by these facts, we propose to replace a dense linear layer in any neural network by an architecture based on the butterfly network. The proposed architecture significantly improves upon the quadratic number of weights required in a standard dense layer to nearly linear with little compromise in expressibility of the resulting operator. In a collection of wide variety of experiments, including supervised prediction on both the NLP and vision data, we show that this not only produces results that match and at times outperform existing well-known architectures, but it also offers faster training and prediction in deployment. To understand the optimization problems posed by neural networks with a butterfly network, we also study the optimization landscape of the encoder-decoder network, where the encoder is replaced by a butterfly network followed by a dense linear layer in smaller dimension. Theoretical result presented in the paper explains why the training speed and outcome are not compromised by our proposed approach.

研究の動機と目的

  • 全結合層のパrameter数を O(n²) からほぼ O(n log n) に削減しつつ、モデルの表現力は維持すること。
  • パフォーマンスを損なわず、深層ニューラルネットワークにおけるトレーニングおよび推論速度を向上させること。
  • 特にエンコーダデコーダ設定における、バタフライ構造を用いた層の最適化のあり方を分析すること。
  • 低ランク行列近似および教師あり学習において、学習可能な切り捨てられたバタフライネットワークの有効性を示すこと。
  • バタフライネットワークの対数的深さが勾配降下法の収束を妨えるかどうかを検討すること。

提案手法

  • 標準の全結合層を、J₁ᵀW'J₂ の合成構造に置き換える。ここで J₁ および J₂ は切り捨てられたバタフライネットワーク、W' は小さな全結合層である。
  • Fast Johnson-Lindenstrauss Transform (FJLT) を理論的基盤とし、バタフライネットワークに続くランダム射影として表現する。
  • バタフライネットワークを、O(log n) の深さを持つ階層的グラフとして構造化し、各層に O(n) 個の非ゼロ重みを含め、互いに重複しない 2×2 ガジェットに配置する。
  • バタフライ構造を固定したまま、標準的な誤差逆伝播法を用いて小さな全結合層 W' の重みをエンドツーエンドで学習する。
  • 低ランク行列近似の実験において、入力行にランダムな置換を施し、データセット全体にわたる特異値のバランスを取るために行列を正規化する。
  • 低ランク行列近似タスクにおいて、学習可能なバタフライ行列を、インドクなど(2019)のスパースな学習可能行列(N=1)、ランダムなスパース行列(クラークソン&ウッドラフ、2009)、およびガウス行列と比較する。

実験結果

リサーチクエスチョン

  • RQ1固定トポロジーを持つスパースで構造化されたバタフライネットワークが、モデルの精度を維持したまま、全結合層に置き換え可能か?
  • RQ2バタフライネットワークアーキテクチャの対数的深さが、深層ネットワークにおける勾配降下法の収束を妨げるか?
  • RQ3低ランク行列近似において、学習可能なバタフライスケッチは、学習可能なスパースまたはランダムスパーススケッチと比べてどの程度優れているか?
  • RQ4ビジョンおよび自然言語処理タスクにおいて、バタフライアーキテクチャが表現力に影響を与えることなく、どの程度パラメータ数を削減できるか?
  • RQ5インドクら(2019)の研究と同様に、バタフライ構造が教師あり学習における行列近似に効果的に応用可能か、近似誤差が改善されるか?

主な発見

  • 提案されたバタフライベースのアーキテクチャは、複数の NLP およびビジョンベンチマークにおいて、標準の全結合層と同等またはそれ以上のテスト誤差を達成した。
  • 低ランク行列近似において、学習可能なバタフライスケッチは、スパースな学習可能行列(N=1)および全結合の学習可能行列(N=20)よりも、ℓ=20、k=10 の条件下で低いテスト誤差を達成した。
  • バタフライアーキテクチャを用いたトレーニングは著しく高速であり、わずか数イテレーションでスパースベースラインを上回るテスト誤差を達成した。
  • 理論的分析により、バタフライエンコーダを備えたエンコーダデコーダネットワークの最適化のあり方が安定しており、構造的スパース性が加わっても収束が保証されていることが示された。
  • 本手法により、パラメータ数を O(n²) からほぼ O(n log n) に削減でき、精度損失を最小限に抑えながら、高速な推論とトレーニングが可能になった。
  • 実験的結果から、複数の全結合層をバタフライ構造に置き換えることが実用的である可能性があることが示唆されたが、本研究では完全に検討されていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。