Skip to main content
QUICK REVIEW

[論文レビュー] FANet: A Feedback Attention Network for Improved Biomedical Image Segmentation

Nikhil Kumar Tomar, Debesh Jha|arXiv (Cornell University)|Mar 31, 2021
Radiomics and Machine Learning in Medical Imaging被引用数 4
ひとこと要約

FANetは、過去の学習エポックの予測をハードアテンションガイドとして活用することで、反復的にバイオメディカル画像セグメンテーションマスクを精錬するフィードバックアテンションネットワークを提案する。現在の特徴マップと過去のエポックのマスクを統合することにより、FANetは最小限の追加計算で7つの公的データセットにおいてセグメンテーション精度を向上させ、アンサンブルやデータオーグメンテーションを用いずにSOTA手法を上回る性能を発揮する。

ABSTRACT

The increase of available large clinical and experimental datasets has contributed to a substantial amount of important contributions in the area of biomedical image analysis. Image segmentation, which is crucial for any quantitative analysis, has especially attracted attention. Recent hardware advancement has led to the success of deep learning approaches. However, although deep learning models are being trained on large datasets, existing methods do not use the information from different learning epochs effectively. In this work, we leverage the information of each training epoch to prune the prediction maps of the subsequent epochs. We propose a novel architecture called feedback attention network (FANet) that unifies the previous epoch mask with the feature map of the current training epoch. The previous epoch mask is then used to provide a hard attention to the learned feature maps at different convolutional layers. The network also allows to rectify the predictions in an iterative fashion during the test time. We show that our proposed extit{feedback attention} model provides a substantial improvement on most segmentation metrics tested on seven publicly available biomedical imaging datasets demonstrating the effectiveness of FANet. The source code is available at \url{https://github.com/nikhilroxtomar/FANet}.

研究の動機と目的

  • バイオメディカル画像におけるクラス内およびクラス間の変動を捉えることができない単一ステップのディーブラーニングモデルの限界を是正すること。
  • トレーニングおよびインフェレンスの両過程で、過去のトレーニングエポックからの情報を活用してセグメンテーション性能を向上させること。
  • マスクを段階的に修正・精錬するフィードバック機構を用いて予測の自己補正を可能にすること。
  • 大規模で多様なデータセットや複雑なデータオーグメンテーション、アンサンブル戦略への依存を軽減すること。
  • 少ないトレーニングエポックで高い精度を維持しつつ、軽量でエンドツーエンドでトレーニング可能なネットワークを構築すること。

提案手法

  • FANetは、前回のトレーニングエポックの予測マスクをハードアテンションマップとして用い、現在のエポックにおける特徴学習をガイドするフィードバック機構を導入する。
  • 特徴マップと前回エポックのマスクを統合するためにMixPoolブロックを用い、要素ごとの乗算により空間アテンションを実現する。
  • チャネルごとの特徴依存関係をモデル化し、表現学習を強化するためにSE-Residualブロックを採用する。
  • コントラスト型アテンション機構を統合して空間アテンションを実現し、背景のノイズを低減させながら関連領域を強調する。
  • インフェレンス時には、同じフィードバック機構を用いてマスクを反復的に精錬する。10回の反復が最適であることが示された。
  • フィードバック機構はトレーニング時およびテスト時の両方で適用され、再トレーニングなしに予測を段階的に改善可能である。

実験結果

リサーチクエスチョン

  • RQ1過去の予測からのフィードバックを用いてマスクを反復的に精錬することで、多様なバイオメディカル画像データセットにおける性能向上が達成できるか?
  • RQ2過去のエポックの予測をハードアテンションとして統合することで、特徴表現とセグメンテーション精度にどのような影響を与えるか?
  • RQ3フィードバック機構により、バイオメディカルセグメンテーションにおいて広範なデータオーグメンテーションやアンサンブル手法の必要性が低下するか?
  • RQ4FANetアーキテクチャにおけるマスク精錬のインフェレンス時反復回数の最適値は何か?
  • RQ5複数のデータセットにわたる精度、トレーニング効率、一般化性能の観点から、FANetはSOTA手法と比較してどのように差をつけるか?

主な発見

  • FANetは、7つのベンチマークバイオメディカル画像セグメンテーションデータセットすべてで顕著な向上を達成し、複数の指標で既存のSOTA手法を上回った。
  • マスク精錬のインフェレンス時反復回数の最適値は10回であるが、2回目でも顕著な向上が観察され、5回目以降は微増にとどまる。
  • アブレーションスタディにより、フィードバックを伴うMixPoolブロックが不可欠であることが確認された。パラメータ数が同一でも、これを削除すると性能が低下した。
  • 少ないトレーニングエポックでほぼSOTAの性能を達成したため、サンプル効率が向上し、収束が速くなった。
  • 定性的な結果では、FANetはSOTA手法と比較して、より明確で背景ノイズの少ない区別がつきやすいセグメンテーションマップを生成した。
  • フィードバック機構は、追加の可学習パラメータや複雑な変換を必要とせず、効果的なハードアテンションメカニズムとして機能し、特徴表現を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。