Skip to main content
QUICK REVIEW

[論文レビュー] Low-Cost Parameterizations of Deep Convolutional Neural Networks

Eran Treister, Lars Ruthotto|arXiv (Cornell University)|May 20, 2018
Model Reduction and Neural Networks参考文献 16被引用数 5
ひとこと要約

本稿では、反応拡散型PDEに基づくアーキテクチャを用いて、チャネル結合のスパarsityを活用することで、深層畳み込みニューラルネットワークの新規で低コストなパrameter化手法を提案する。標準的な全結合畳み込みを、反応拡散PDEから導出された深さ方向、巡回的、または準陰的畳み込み層に置き換えることで、画像分類タスクにおいても精度を維持しつつ、パrameter数と計算量を最大10倍まで削減できる。特に、広いまたは高次元のネットワークに特に有益である。

ABSTRACT

Convolutional Neural Networks (CNNs) filter the input data using a series of spatial convolution operators with compactly supported stencils and point-wise nonlinearities. Commonly, the convolution operators couple features from all channels. For wide networks, this leads to immense computational cost in the training of and prediction with CNNs. In this paper, we present novel ways to parameterize the convolution more efficiently, aiming to decrease the number of parameters in CNNs and their computational complexity. We propose new architectures that use a sparser coupling between the channels and thereby reduce both the number of trainable weights and the computational cost of the CNN. Our architectures arise as new types of residual neural network (ResNet) that can be seen as discretizations of a Partial Differential Equations (PDEs) and thus have predictable theoretical properties. Our first architecture involves a convolution operator with a special sparsity structure, and is applicable to a large class of CNNs. Next, we present an architecture that can be seen as a discretization of a diffusion reaction PDE, and use it with three different convolution operators. We outline in our experiments that the proposed architectures, although considerably reducing the number of trainable weights, yield comparable accuracy to existing CNNs that are fully coupled in the channel dimension.

研究の動機と目的

  • 深層CNNにおけるトレーニング可能なパラメータ数と計算コストを削減すること、特に広いまたは高次元のアーキテクチャに対して。
  • チャネル間の完全な結合畳み込みの非効率性に起因する、チャネル幅の増加に伴うスケーリングの悪さを是正すること。
  • 連続的なPDEモデルを用いて、理論的性質が予測可能でパラメータ効率の良いCNNアーキテクチャを開発すること。
  • パラメータ数を著しく削減することで、メモリ制限のあるデバイス上での効率的な推論とトレーニングを可能にすること。
  • 標準的な畳み込みが計算的に非現実的となる3Dおよび4Dデータ(例:動画、医療画像)へのCNNの適用範囲を拡張すること。

提案手法

  • 時間に依存するPDE、特に反応拡散モデルに基づく、理論的安定性と予測可能性を備えた新しい残差ネットワークアーキテクチャを提案する。
  • 標準的な3次元畳み込みを、深さ方向畳み込みと1×1畳み込みの線形結合に置き換えることで、パラメータ数を削減しつつ表現力は維持する。
  • 深さ方向畳み込みの逆演算(FFTを用いて計算)を適用した後、非線形活性化関数を適用する準陰的スキームを導入し、低コストで完全な空間的結合を実現する。
  • テンソル積構造を用いてチャネル間の巡回的接続を実現し、効率的なFFTベースの計算とチャネル幅に比例する線形スケーリングを可能にする。
  • ゼロパディングまたは巡回拡張されたカーネル上で、高速フーリエ変換(FFT)を用いて畳み込みを効率的に計算し、カーネルサイズへの依存性を低減する。
  • アーキテクチャをPDEの離散近似として導出し、パrameter摂動やノイズに対して理論的ロバスト性を保証する。

実験結果

リサーチクエスチョン

  • RQ1CNNにおけるチャネル結合を、モデルの精度や表現力に損なわれることなくスパース化できるか?
  • RQ2PDEに基づく連続的モデルを、理論的安定性と計算効率を確保できるCNN層にどのように離散化できるか?
  • RQ3完全に結合された畳み込みを深さ方向または巡回的構造に置き換えることで、どの程度パラメータ数と計算コストを削減できるか?
  • RQ4特に3D動画や3D医療画像などの高次元データにおいて、チャネル幅の増加に伴う提案アーキテクチャのスケーリング特性はいかほどか?
  • RQ5広いネットワークにおいて、FFTベースのスパース畳み込み実装が、標準的なcuDNN実装に比べて相対的に速くなるか?

主な発見

  • 提案アーキテクチャは、標準的な完全結合畳み込みCNNと同等またはそれ以上の精度を達成しながら、トレーニング可能なパラメータ数を顕著に削減している。
  • FFTベース実装の実行時間とcuDNNの完全結合畳み込みの実行時間比は、チャネル数に比例して線形に増加し、約200チャネルで有利に働くようになる。
  • 大きなカーネルサイズでは、FFTベース実装が優れた性能を示す。これは、直接的なGEMMベース手法とは異なり、実行時間がカーネルサイズに依存しないためである。
  • 準陰的スキームにより、深さ方向畳み込みのみで完全な空間的結合を実現し、低コストで強力な特徴相互作用を達成できる。
  • 巡回畳み込み構造により、パラメータ数が入力チャネル数と出力チャネル数の積に比例するのではなく、チャネル幅に比例するようになり、メモリ使用量を著しく削減できる。
  • 3Dおよび4Dデータに対して特に有利であり、標準的な3D CNNが高パラメータ数と高計算要求により計算的に非現実的となる状況においても有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。