Skip to main content
QUICK REVIEW

[論文レビュー] Bridging 2D and 3D Segmentation Networks for Computation Efficient Volumetric Medical Image Segmentation: An Empirical Study of 2.5D Solutions

Yichi Zhang, Qingcheng Liao|arXiv (Cornell University)|Oct 13, 2020
Advanced Neural Network Applications被引用数 6
ひとこと要約

本論文は、2.5次元医療画像セグメンテーション手法の包括的な実験的調査を提案しており、2Dと3D CNNの間を橋渡しすることで、計算効率の高いボリュメトリックセグメンテーションを実現する。CTおよびMRIデータセット上で、3つのカテゴリ—マルチビュー統合、スライス間特徴の統合、2D/3D特徴の統合—を評価することで、2.5D手法が、特にアノイソトロピックなボリュームにおいて3D CNNが性能を発揮できない状況で、計算量とパラメータ数を著しく削減しながらも3D CNNの性能を同等または上回ることを示している。

ABSTRACT

Recently, deep convolutional neural networks have achieved great success for medical image segmentation. However, unlike segmentation of natural images, most medical images such as MRI and CT are volumetric data. In order to make full use of volumetric information, 3D CNNs are widely used. However, 3D CNNs suffer from higher inference time and computation cost, which hinders their further clinical applications. Additionally, with the increased number of parameters, the risk of overfitting is higher, especially for medical images where data and annotations are expensive to acquire. To issue this problem, many 2.5D segmentation methods have been proposed to make use of volumetric spatial information with less computation cost. Despite these works lead to improvements on a variety of segmentation tasks, to the best of our knowledge, there has not previously been a large-scale empirical comparison of these methods. In this paper, we aim to present a review of the latest developments of 2.5D methods for volumetric medical image segmentation. Additionally, to compare the performance and effectiveness of these methods, we provide an empirical study of these methods on three representative segmentation tasks involving different modalities and targets. Our experimental results highlight that 3D CNNs may not always be the best choice. Despite all these 2.5D methods can bring performance gains to 2D baseline, not all the methods hold the benefits on different datasets. We hope the results and conclusions of our study will prove useful for the community on exploring and developing efficient volumetric medical image segmentation methods.

研究の動機と目的

  • ボリュメトリック医療画像セグメンテーションにおける3D CNNの高い計算コストと過学習リスクを軽減すること。
  • 異なる医療画像モodalitiesおよび解剖的ターゲットにおいて、さまざまな2.5D手法の性能を評価・比較すること。
  • 2.5D手法の包括的実験的ベンチマークを提供し、データセットやタスクをまたがる体系的な比較の空白を埋めること。
  • データセットの特性と計算制約に基づいて、最適な2.5Dアーキテクチャの選定を研究者に支援すること。

提案手法

  • 2.5D手法を3種類に分類:マルチビュー統合、RNNやアテンションメカニズムを用いたスライス間情報の統合、エンコーディング段階または出力段階での2Dおよび3D特徴の統合。
  • すべての手法で一貫性のある比較が行えるよう、2D U-Netと3D U-Netをバックボーンネットワークとして採用。
  • マルチビュー統合は、冠状、 sagittal、 coronal 視点ごとに別個の2Dネットワークを学習し、予測を統合することで実装。
  • スライス間の文脈を統合するために、1次元または3次元のRNNと squeeze-and-excitation (SE) ブロックを用い、スライス間の空間的依存性をモデル化。
  • 2Dおよび3D特徴を、2Dおよび3Dエンコーダーからの特徴を連結するか、要素ごとの加算によって統合。
  • すべてのモデルで同一のハイパーパramータ、データオーグメンテーション、トレーニングプロトコルを用いて、公平な比較を実施。

実験結果

リサーチクエスチョン

  • RQ12.5Dセグメンテーションは、多様な医療画像処理タスクにおいて、2Dおよび3Dベースラインを一貫して上回るか?
  • RQ2どの2.5D手法アーキテクチャが、性能、推論速度、モデル複雑性の間で最良のトレードオフを達成するか?
  • RQ33D CNNが効果を発揮しにくいアノイソトロピックなボリュメトリックデータにおいて、2.5D手法はどのように性能を発揮するか?
  • RQ4特徴統合の位置(エンコーディング段階 vs. 出力段階)が、セグメンテーション精度およびトレーニング効率に与える相対的影響は何か?
  • RQ52.5D手法は、パrameter数とトレーニング時間を削減しながらも、3D CNNと同等の性能を達成できるか?

主な発見

  • すべての2.5D手法が2D U-Netベースラインを上回った。特にマルチビュー統合は、3D U-Netと同等の性能を達成したが、3つの別個のネットワークを学習する必要があった。
  • 心臓MRIでは、出力段階での特徴統合がエンコーディング段階での統合を上回ったが、脾臓CTおよび前立腺MRIでは、すべてのタスクで優位な統合手法は特定できなかった。
  • RNNおよびアテンションベースのスライス間統合は、単純なマルチスライス入力よりも性能向上を示したが、データセットによってその向上幅は変動し、一貫した優位性は示さなかった。
  • エンコーディング段階での2Dおよび3D特徴統合は、計算コストを低く抑えながらも高い精度を達成した。一方、出力段階での統合は3Dネットワークのトレーニングを加速させたが、推論時間を延長した。
  • すべての2.5D手法は3D U-Netと比較して顕著に少ないパラメータ数と高速なトレーニングを実現した。例えば、2D U-Netは0.487Mパラメータであったのに対し、3D U-Netは1.403Mであった。トレーニング時間も2Dベースラインの1.00x~2.32xにまで短縮された。
  • アノイソトロピックなボリューム(例:低スライス解像度のCT)では、3D CNNが2.5D手法に比べて性能を発揮しないことが多く、3Dモデルが常に最適とは限らないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。