Skip to main content
QUICK REVIEW

[論文レビュー] Frequency Domain Convolutional Neural Network: Accelerated CNN for Large Diabetic Retinopathy Image Classification

Ee Fey Goh, Zhiyuan Chen|arXiv (Cornell University)|Jun 24, 2021
Retinal Imaging and Analysis参考文献 15被引用数 4
ひとこと要約

本稿では、周波数ドメイン畳み込み(FDC)および周波数ドメインプーリング(FDP)層を備えた周波数ドメイン畳み込みニューラルネットワーク(FDCNN)を提案し、大規模な糖尿病網膜症(DR)画像の学習を高速化する。RFFTを活用し、カーネル初期化、アーティファクト除去、チャネル独立畳み込みを組み合わせることで、FDCNNは標準のCNNと比較して学習が54.21%高速化され、メモリ効率が70.74%向上した。また、FDC層を全層にした変更版VGG16は、DR分類で95.63%の精度に達した。

ABSTRACT

The conventional spatial convolution layers in the Convolutional Neural Networks (CNNs) are computationally expensive at the point where the training time could take days unless the number of layers, the number of training images or the size of the training images are reduced. The image size of 256x256 pixels is commonly used for most of the applications of CNN, but this image size is too small for applications like Diabetic Retinopathy (DR) classification where the image details are important for accurate classification. This research proposed Frequency Domain Convolution (FDC) and Frequency Domain Pooling (FDP) layers which were built with RFFT, kernel initialization strategy, convolution artifact removal and Channel Independent Convolution (CIC) to replace the conventional convolution and pooling layers. The FDC and FDP layers are used to build a Frequency Domain Convolutional Neural Network (FDCNN) to accelerate the training of large images for DR classification. The Full FDC layer is an extension of the FDC layer to allow direct use in conventional CNNs, it is also used to modify the VGG16 architecture. FDCNN is shown to be at least 54.21% faster and 70.74% more memory efficient compared to an equivalent CNN architecture. The modified VGG16 architecture with Full FDC layer is reported to achieve a shorter training time and a higher accuracy at 95.63% compared to the original VGG16 architecture for DR classification.

研究の動機と目的

  • 大規模な糖尿病網膜症(DR)画像における深層CNNの学習にかかる高コストな計算負荷に対処すること。
  • 特に高解像度画像において遅く、メモリを多く消費する標準的な空間畳み込み層の制限を克服すること。
  • 精度を維持したまま学習速度と効率を向上させる周波数ドメインの代替手法、すなわちFDCおよびFDP層を開発すること。
  • 微細な特徴が重要となるため、大規模な画像サイズ(例:256x256以上)を効果的に活用できるようにすること。
  • 既存のアーキテクチャ(例:VGG16)にこれらの層を統合し、アーキテクチャの大幅な見直しを伴わずに性能向上を実現すること。

提案手法

  • 空間畳み込みを周波数ドメイン演算に変換するため、実数値のRFFTを用いた周波数ドメイン畳み込み(FDC)層を提案し、計算複雑度を低減する。
  • 周波数ドメイン学習に特化したカーネル初期化戦略を導入し、学習の安定性と収束性を向上させる。
  • 周波数ドメイン演算中に生じる歪みを最小限に抑えるため、畳み込みアーティファクト除去技術を適用する。
  • チャネル処理を分離することで、周波数ドメインにおける計算効率を向上させるチャネル独立畳み込み(CIC)を採用する。
  • 空間的ダウンサンプリングを周波数ドメインで実行する周波数ドメインプーリング(FDP)層を開発し、重要な特徴を保持しながら次元を低減する。
  • 標準の畳み込み層の即時置き換えが可能な「フルFDC層」を提案し、VGG16のような既存のCNNに統合可能にする。

実験結果

リサーチクエスチョン

  • RQ1周波数ドメイン演算は、大規模な医療画像におけるCNNの学習時間とメモリ使用量を顕著に削減できるか?
  • RQ2FDCNNは、糖尿病網膜症分類において、標準のCNNと比較して精度と効率の点でどのように異なるか?
  • RQ3FDCおよびFDP層は、高解像度の網膜画像における診断に有用な特徴をどの程度保持できるか?
  • RQ4フルFDC層は、VGG16のような既存のアーキテクチャに再訓練なしに効果的に統合できるか?
  • RQ5提案手法は、より大きな画像入力の利用を可能にすると同時に、分類精度を維持または向上できるか?

主な発見

  • FDCNNは、同等の標準CNNアーキテクチャと比較して、少なくとも54.21%の高速化を達成した。
  • FDCNNモデルは、学習中、従来のCNNと比較して70.74%高いメモリ効率を示した。
  • フルFDC層を搭載した変更版VGG16は、糖尿病網膜症分類でテスト精度95.63%に達し、元のVGG16を上回った。
  • 周波数ドメイン演算の活用により、速度やメモリ効率を損なわず、より大きな画像サイズでの学習が可能になった。
  • 提案されたカーネル初期化およびアーティファクト除去技術は、周波数ドメインにおける学習の安定性と特徴の忠実性を顕著に向上させた。
  • フルFDC層は、アーキテクチャの再設計なしに既存のCNNにスムーズに統合可能であり、性能向上を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。