Skip to main content
QUICK REVIEW

[論文レビュー] CFPNet-M: A Light-Weight Encoder-Decoder Based Network for Multimodal Biomedical Image Real-Time Segmentation

Ange Lou, Shuyue Guan|arXiv (Cornell University)|May 10, 2021
AI in cancer detection参考文献 52被引用数 16
ひとこと要約

CFPNet-M は、マルチモodal生体医療画像のリアルタイムセグメンテーションを目的とした軽量でエンコーダーデコーダー構造のニューラルネットワークであり、拡張されたチャネル別CNNモジュールとアーキテクチャの簡素化により、パラメータ数を 0.65M(U-Net の 2%)に削減しながらも高い精度を維持している。256×192 の入力で単一の RTX 2070Ti GPU で 80 FPS の推論速度を達成し、Tanimoto 同一性を用いた評価で、5 種類の多様な医療画像データセットにおいて、より大きなモデルを上回る性能を示している。

ABSTRACT

Currently, developments of deep learning techniques are providing instrumental to identify, classify, and quantify patterns in medical images. Segmentation is one of the important applications in medical image analysis. In this regard, U-Net is the predominant approach to medical image segmentation tasks. However, we found that those U-Net based models have limitations in several aspects, for example, millions of parameters in the U-Net consuming considerable computation resource and memory, lack of global information, and missing some tough objects. Therefore, we applied two modifications to improve the U-Net model: 1) designed and added the dilated channel-wise CNN module, 2) simplified the U shape network. Based on these two modifications, we proposed a novel light-weight architecture -- Channel-wise Feature Pyramid Network for Medicine (CFPNet-M). To evaluate our method, we selected five datasets with different modalities: thermography, electron microscopy, endoscopy, dermoscopy, and digital retinal images. And we compared its performance with several models having different parameter scales. This paper also involves our previous studies of DC-UNet and some commonly used light-weight neural networks. We applied the Tanimoto similarity instead of the Jaccard index for gray-level image measurements. By comparison, CFPNet-M achieves comparable segmentation results on all five medical datasets with only 0.65 million parameters, which is about 2% of U-Net, and 8.8 MB memory. Meanwhile, the inference speed can reach 80 FPS on a single RTX 2070Ti GPU with the 256 by 192 pixels input size.

研究の動機と目的

  • U-Net に基づくモデルが生体医療画像セグメンテーションにおいて高い計算リソースとメモリ消費を要する問題に対処すること。
  • 困難なオブジェクトのセグメンテーション性能を向上させ、グローバル特徴表現を強化すること。
  • リソース制約のあるデバイスでもリアルタイム推論が可能な軽量アーキテクチャの開発。
  • 熱画像、内 endoscopy、網膜画像を含む、多様な医療画像モodal における性能評価。
  • 最小限のパラメータ数でも、主に Tanimoto 同一性を評価指標として用いることで、競争力あるセグメンテーション精度を達成できることの実証。

提案手法

  • パラメータ数を削減しつつ、マルチスケールのチャネル固有特徴を捉えるために、拡張されたチャネル別CNNモジュールを提案した。
  • 不要な層や接続を削除することで、U-Net のエンコーダーデコーダー構造を簡素化し、モデルの複雑さを低減した。
  • 特徴表現の向上を図るために、拡張されたチャネル別モジュールをエンコーダー部に統合し、計算負荷を増加させずに実現した。
  • 空間解像度を保持し、勾配の流れを促進するために、対称的なスキップ接続設計を採用した。
  • バイナリクロスエントロピー損失とDice係数最適化を用いて、エンドツーエンドでネットワークを訓練した。
  • グレーレベル医療画像の主な評価指標として、Tanimoto 同一性(F1スコア)を採用した。

実験結果

リサーチクエスチョン

  • RQ1顕著に削減されたパラメータ数でも、マルチモーダル生体医療画像における競争力あるセグメンテーション精度を維持できるか?
  • RQ2拡張されたチャネル別CNNモジュールの統合により、小形または検出が困難な構造の特徴表現とセグメンテーション性能が向上するか?
  • RQ3簡素化されたエンコーダーデコーダー構造は、性能を損なわずにリアルタイム推論を達成できるか?
  • RQ4CFPNet-M は、U-Net や MobileNet のような軽量ネットワークと比較して、精度と速度の両面で優れているか?
  • RQ5グレーレベル医療画像において、Tanimoto 同一性を用いることで、Jaccard係数に比べてより信頼性の高いセグメンテーション評価が得られるか?

主な発見

  • CFPNet-M は、熱画像、内視鏡、皮膚画像、電子顕微鏡、網膜画像を含む、5 種類の多様な生体医療画像データセットにおいて、より大きなモデルと同等のセグメンテーション性能を達成した。
  • モデルのパラメータ数はわずか 0.65M であり、標準的な U-Net の 2% に相当する。
  • メモリ使用量はたったの 8.8 MB にまで削減され、標準的な U-Net と比較して顕著にメモリフットプリントが小さくなった。
  • 256×192 の入力解像度で、単一の RTX 2070Ti GPU で 80 FPS の推論速度を達成した。
  • 評価指標として Tanimoto 同一性を用いることで、グレーレベル画像におけるセグメンテーション性能のより堅牢で正確な評価が可能になった。
  • 提案されたアーキテクチャは、パラメータ効率性と推論速度の両面で、DC-UNet や標準的な軽量ネットワークを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。