Skip to main content
QUICK REVIEW

[論文レビュー] Multi-level Context Gating of Embedded Collective Knowledge for Medical Image Segmentation

Maryam Asadi-Aghbolaghi, Reza Azad|arXiv (Cornell University)|Mar 10, 2020
AI in cancer detection参考文献 40被引用数 19
ひとこと要約

本稿では、多層の双方向ConvLSTMを用いた非線形スキップ接続、チャネルワイドな特徴再キャリブレーションのための圧縮・励起(SE)モジュール、およびエンコーダー経路における密集型畳み込みを統合することで、特徴再利用と表現力を向上させる、医療画像セグメンテーション向けに強化されたU-Netアーキテクチャ、MCGU-Netを提案する。このモデルは、DRIVE、ISIC 2017/2018、PH²を含む6つの医療画像セグメンテーションベンチマークで最先端の性能を達成し、DiceスコアおよびIoUスコアにおいて顕著な向上を示した。

ABSTRACT

Medical image segmentation has been very challenging due to the large variation of anatomy across different cases. Recent advances in deep learning frameworks have exhibited faster and more accurate performance in image segmentation. Among the existing networks, U-Net has been successfully applied on medical image segmentation. In this paper, we propose an extension of U-Net for medical image segmentation, in which we take full advantages of U-Net, Squeeze and Excitation (SE) block, bi-directional ConvLSTM (BConvLSTM), and the mechanism of dense convolutions. (I) We improve the segmentation performance by utilizing SE modules within the U-Net, with a minor effect on model complexity. These blocks adaptively recalibrate the channel-wise feature responses by utilizing a self-gating mechanism of the global information embedding of the feature maps. (II) To strengthen feature propagation and encourage feature reuse, we use densely connected convolutions in the last convolutional layer of the encoding path. (III) Instead of a simple concatenation in the skip connection of U-Net, we employ BConvLSTM in all levels of the network to combine the feature maps extracted from the corresponding encoding path and the previous decoding up-convolutional layer in a non-linear way. The proposed model is evaluated on six datasets DRIVE, ISIC 2017 and 2018, lung segmentation, $PH^2$, and cell nuclei segmentation, achieving state-of-the-art performance.

研究の動機と目的

  • 医療画像セグメンテーションにおける高い解剖学的変異性とノイズの多いデータの課題に対処すること。
  • コンテキストに適応したアテンションと密集した特徴再利用を統合することで、U-Netにおける特徴表現を向上させること。
  • 単純な連結を超えて、非線形的かつゲーティング融合を用いたBConvLSTMによるスキップ接続の強化。
  • 効率的なアーキテクチャ的変更を通じて、最小限の計算オーバーヘッドでモデル性能を向上させること。
  • 提案された構成要素の有効性を多様な医療画像処理タスクにわたり検証すること。

提案手法

  • グローバルコンテキストを用いてチャネルワイドな特徴応答を再キャリブレーションするため、デコーディングパスに圧縮・励起(SE)ブロックを統合する。
  • すべてのスキップ接続に双方向畳み込みLSTM(BConvLSTM)を採用し、高解像度のエンコード済み特徴と意味論的デコード済み特徴を非線形的に融合する。
  • 最終エンコーダー層に密集型畳み込みブロックを適用し、直接的なスキップ接続を通じて特徴再利用とより深い勾配伝播を促進する。
  • 各アップ畳み込み層の後にバッチ正規化(BN)を適用し、収束を加速させるとともに一般化誤差を低減する。
  • エンコーダー経路にVGGベースのバックボーンを採用し、事前学習済みImageNet重みを用いた転移学習を可能にする。
  • すべての構成要素を統合した統一されたMCGU-Netアーキテクチャを構築し、空間解像度を保持しながら意味理解を強化する。

実験結果

リサーチクエスチョン

  • RQ1BConvLSTMは、単純な連結を超えて、U-Netのスキップ接続における特徴統合を改善できるか?
  • RQ2SEブロックの統合により、情報量の多いチャネルに注目することで、特徴表現が向上するか?
  • RQ3エンコーダー経路における密集型畳み込みは、特徴再利用とモデルの表現力の向上に寄与するか?
  • RQ4これらのアーキテクチャ的変更は、多様な医療画像処理タスクにおいて、どの程度セグメンテーション精度を向上させるか?
  • RQ5提案されたMCGU-Netは、ベンチマークデータセットにおいて最先端の手法と比較してどのように差をつけるか?

主な発見

  • 3つの密集ブロックを搭載したMCGU-Netは、ISIC 2018データセットで最高のDiceスコア0.9306を達成し、ベースラインのU-Netおよび他の最先端手法を上回った。
  • SEブロックの導入により、ISIC 2018でDiceスコアが約0.0011向上し、定性的な比較において明確でより正確なセグメンテーションマスクが得られた。
  • BConvLSTMを用いたスキップ接続は、境界エラーを低減させ、細分化されたセグメンテーションを改善したことが、ISIC 2018における視覚的比較で示された。
  • バッチ正規化により、学習が約2倍速くなり、収束が早まり、一般化誤差が低減した。
  • MCGU-Netは、DRIVE(Dice: 0.9295)、PH²(Dice: 0.9771)、肺セグメンテーション(Dice: 0.9884)を含む、全6つの評価済みデータセットで最先端の性能を達成した。
  • アブレーションスタディにより、各構成要素(BConvLSTM、SEブロック、密集ブロック)が段階的に性能向上に寄与しており、フルモデルが最適な結果を達成したことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。