Skip to main content
QUICK REVIEW

[論文レビュー] Band-limited Training and Inference for Convolutional Neural Networks

Adam Dziedzic, John Paparrizos|arXiv (Cornell University)|Nov 21, 2019
Image and Signal Denoising Methods被引用数 21
ひとこと要約

本論文では、FFTベースの畳み込みを用いて、順伝播および逆伝播の両過程でフィルタおよび入力の周波数スペクトルを制約することにより、畳み込みニューラルネットワーク(CNN)におけるバンド制限型トレーニングと推論を提案する。この手法により、最小限の精度損失でGPUメモリと計算量を顕著に削減でき、アーキテクチャ非依存の安定した圧縮技術を提供し、より高い圧縮率でも滑らかに性能が低下する。

ABSTRACT

The convolutional layers are core building blocks of neural network architectures. In general, a convolutional filter applies to the entire frequency spectrum of the input data. We explore artificially constraining the frequency spectra of these filters and data, called band-limiting, during training. The frequency domain constraints apply to both the feed-forward and back-propagation steps. Experimentally, we observe that Convolutional Neural Networks (CNNs) are resilient to this compression scheme and results suggest that CNNs learn to leverage lower-frequency components. In particular, we found: (1) band-limited training can effectively control the resource usage (GPU and memory); (2) models trained with band-limited layers retain high prediction accuracy; and (3) requires no modification to existing training algorithms or neural network architectures to use unlike other compression schemes.

研究の動機と目的

  • トレーニング中にCNNのフィルタおよび入力の周波数スペクトルを制限することで、リソース使用量を削減しつつ精度を損なわないかを調査すること。
  • 既存のトレーニングアルゴリズムやネットワークアーキテクチャの変更を必要としない、安定的で効率的かつ汎用的なCNN圧縮手法を開発すること。
  • 周波数ドメインでの圧縮が、特に高周波ノイズや対策攻撃に対するモデルのロバストネスに与える影響を評価すること。
  • 連続的な圧縮ノブを用いて、計算効率と予測性能のトレードオフを調査すること。

提案手法

  • 本手法は、入力およびフィルタテンソルを周波数ドメインに変換するFFTベースの畳み込みを用い、要素ごとの乗算の前に高周波成分を切り捨てることで実装される。
  • 順伝播および逆伝播の両過程でフーリエスペクトルを制限するバンド制限型畳み込み層を実装し、勾配を許容可能な周波数成分に射影する。
  • 2次元FFTにおける共役対称性を活用し、周波数マップを再利用し、高速な複素数演算を用いることで効率を向上させる。
  • 本手法は1次元および2次元データをカバーし、時系列および画像分類タスクに適用可能であり、標準的なトレーニング手順に変更を加えない。
  • 圧縮は、固定数の高周波成分を破棄することで実現され、復元はゼロパディングおよび逆FFTによって達成される。
  • 本手法は標準的なディープラーニングフレームワークと互換性があり、特別なライブラリや再トレーニングスキームを必要としない。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャ的・アルゴリズム的変更なしに、CNNのフィルタおよび入力の周波数スペクトルの一部のみを用いて効果的にトレーニング可能か?
  • RQ2バンド制限型トレーニングが、さまざまな圧縮率においてモデルの精度、メモリ使用量、計算コストに与える影響は?
  • RQ3バンド制限型トレーニングは、高周波ノイズや対策摂動に対してロバストネスを向上させるか?
  • RQ4固定数の係数を破棄する係数ベースの圧縮と、エネルギーの固定割合を破棄する適応的周波数プルーニングとでは、精度保持の観点でどちらが優れるか?
  • RQ5バンド制限型トレーニングは、1次元時系列データや2次元画像など、多様なデータモダリティに効果的に適用可能か?

主な発見

  • バンド制限型トレーニングにより、GPUメモリ使用量が最大80%削減(例:118GBから21GB)され、画像タスクにおけるDenseNet-121ではわずかな精度低下にとどまる。
  • 50%の周波数圧縮でトレーニングされたモデルは、時系列データで64.40%のフルスペクトルモデルと比較して59.34%のテスト精度を維持し、滑らかな性能低下を示す。
  • 固定数の係数を破棄する係数ベースの圧縮が、エネルギーの固定割合を破棄する適応的プルーニングよりも精度保持に優れる。
  • バンド制限型モデルは、高周波ノイズおよび対策攻撃に対して優れたロバストネスを示し、低周波表現への有益なインダクティブバイアスを有している可能性がある。
  • 本手法は、さまざまなネットワーク(例:ResNet-18、DenseNet-121、FCN)で安定したトレーニングを維持し、最適化アルゴリズムやネットワークアーキテクチャの変更を必要としない。
  • 本手法はリソース使用量と精度の連続的かつ柔軟なトレードオフを可能にし、ストリーミングおよびオフコアアプリケーションに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。