Skip to main content
QUICK REVIEW

[論文レビュー] Learning Convolutional Neural Networks in the Frequency Domain

Hengyue Pan, Chen, Yixin|arXiv (Cornell University)|Apr 14, 2022
Neural Networks and Applications被引用数 5
ひとこと要約

本論文では、離散フーリエ変換(DFT)を用いて周波数ドメイン全体で訓練される新しい畳み込みニューラルネットワーク、CEMNETを提案する。畳み込み演算を計算コストの高いものから、クロス相関定理を用いた効率的な要素ごとの乗算に置き換える。過学習を軽減するためのウェイト固定化機構を導入し、バッチ正則化、Leaky ReLU、ドロップアウトの周波数ドメイン版を設計することで、MNISTおよびCIFAR-10で最先端の性能を達成。FLOPsは削減され、CIFAR-10では70%以上の精度を達成した。これは、このようなモデルで初めての成果である。

ABSTRACT

Convolutional neural network (CNN) has achieved impressive success in computer vision during the past few decades. The image convolution operation helps CNNs to get good performance on image-related tasks. However, the image convolution has high computation complexity and hard to be implemented. This paper proposes the CEMNet, which can be trained in the frequency domain. The most important motivation of this research is that we can use the straightforward element-wise multiplication operation to replace the image convolution in the frequency domain based on the Cross-Correlation Theorem, which obviously reduces the computation complexity. We further introduce a Weight Fixation mechanism to alleviate the problem of over-fitting, and analyze the working behavior of Batch Normalization, Leaky ReLU, and Dropout in the frequency domain to design their counterparts for CEMNet. Also, to deal with complex inputs brought by Discrete Fourier Transform, we design a two-branches network structure for CEMNet. Experimental results imply that CEMNet achieves good performance on MNIST and CIFAR-10 databases.

研究の動機と目的

  • 畳み込みニューラルネットワークの計算複雑度を、周波数ドメインで直接学習することで低減すること。
  • DFTにより入力が複素数値をとる周波数ドメインでの学習という課題に対処し、効果的なバックプロパゲーションを可能にすること。
  • バッチ正則化、Leaky ReLU、ドロップアウトなどの標準的なディープラーニングコンponentsの周波数ドメイン版を設計すること。
  • 新規なウェイト固定化機構を用いて、周波数ドメインでの学習における過学習を克服すること。
  • 端末から端末までの周波数ドメインでの学習が、画像分類タスクにおいて実行可能で効果的であることを示し、標準ベンチマークで競争力のある性能を達成すること。

提案手法

  • コアメカニズムは、クロス相関定理を用いて、入力とカーネルのDFTの積(複素共役を含む)を要素ごとの乗算に置き換えることで、画像畳み込みを周波数ドメインで実現する。この定理は、相互相関のDFTが、入力のDFTとカーネルの複素共役の要素ごとの積に等しいことを示す。
  • DFTからの複素数値の特徴マップを処理するための2本のブランチを持つネットワークアーキテクチャを設計し、バックプロパゲーション中に実数値のパラメータ更新を可能にする。
  • 初期ブロックのウェイトを固定することで、トレーニング中に可学習パラメータ数を減らすことで、過学習を軽減するウェイト固定化機構を導入。
  • バッチ正則化、Leaky ReLU、ドロップアウトの周波数ドメイン版を導出し、実装することで、学習の安定性と一般化性能を維持。
  • 標準的な最適化手法を用い、コサインスケジュールの学習率スケジューリングでモデルを訓練。CIFAR-10の実験では、データオーグメンテーションは使用しない。
  • 前向きおよび逆向きの演算をFLOPs単位で測定し、計算効率の向上を定量的に評価。

実験結果

リサーチクエスチョン

  • RQ1DFTを用いて、標準的な畳み込み演算を要素ごとの乗算に置き換えることで、周波数ドメインでエンドツーエンドのCNNを学習可能か?
  • RQ2バッチ正則化、ReLU、ドロップアウトといった標準的なディープラーニングコンponentsを、周波数ドメインで効果的に適応できるか?
  • RQ3特にパラメータ更新が制限される状況において、周波数ドメイン学習における過学習を軽減するためのメカニズムは何か?
  • RQ4周波数ドメインネットワークは、MNISTやCIFAR-10といった標準的なビジョンベンチマークで競争力のある性能を達成できるか?
  • RQ5前向きおよび逆向きのパスにおけるFLOPsの観点から、周波数ドメインでの学習の計算複雑度は、標準CNNと比べてどうなるか?

主な発見

  • CEMNETはMNISTデータセットで0.67%のテスト誤差を達成し、以前の周波数ドメインモデルを上回り、標準CNNに近い性能を示した。
  • CIFAR-10では、スモールCEMNETが22.40%のテスト誤差を達成し、対応するスモールCNN(21.07%)と同等の一般化性能を示した。FLOPsが削減されているにもかかわらず、顕著な性能を発揮した。
  • ラージCEMNETはCIFAR-10で21.63%のテスト誤差を達成し、深さに応じた適切なスケーリングを示したが、ウェイト固定化による勾配消失の影響で、フルスケールCNNに比べて性能がやや劣った。
  • CEMNETの前向きおよび逆向きのFLOPsは、それぞれ約368Kおよび481Kと、標準CNNと比較して顕著に削減された。これは、顕著な計算リソースの節約を示している。
  • CEMNETは、CIFAR-10で70%以上の精度を達成した最初の周波数ドメインモデルであり、周波数ドメインディープラーニング分野における重要なマイルストーンを達成した。
  • 2本のブランチ構造は、複素数値のDFT出力を効果的に処理でき、実数値の勾配を用いた安定な学習を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。