Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Context-Aware Network for Abdominal Multi-organ Segmentation

Fan Zhang, Yu Wang|arXiv (Cornell University)|Sep 22, 2021
Radiomics and Machine Learning in Medical Imaging参考文献 10被引用数 13
ひとこと要約

本稿では、腹部CTスキャンにおける多臓器セグメンテーションに向け、新規の効率的SegNetを用いた、全体ボリュームに基づく粗-細かいフレームワークを提案する。非等方的畳み込みとストリッププーリングモジュールを採用し、計算コストを低く抑えながら長距離で非等方的なコンテキストを捉える。FLARE2021バリデーションセットにおいて、平均DSC 0.895、NSD 0.775の最先端性能を達成し、コンテストで1位を獲得した。

ABSTRACT

The contextual information, presented in abdominal CT scan, is relative consistent. In order to make full use of the overall 3D context, we develop a whole-volume-based coarse-to-fine framework for efficient and effective abdominal multi-organ segmentation. We propose a new efficientSegNet network, which is composed of basic encoder, slim decoder and efficient context block. For the decoder module, anisotropic convolution with a k*k*1 intra-slice convolution and a 1*1*k inter-slice convolution, is designed to reduce the computation burden. For the context block, we propose strip pooling module to capture anisotropic and long-range contextual information, which exists in abdominal scene. Quantitative evaluation on the FLARE2021 validation cases, this method achieves the average dice similarity coefficient (DSC) of 0.895 and average normalized surface distance (NSD) of 0.775. This method won the 1st place on the 2021-MICCAI-FLARE challenge. Codes and models are available at https://github.com/Shanghai-Aitrox-Technology/EfficientSegmentation.

研究の動機と目的

  • 高い解剖学的可変性と限られたGPUメモリを伴う腹部CTスキャンにおける正確で効率的な多臓器セグメンテーションの課題に対処すること。
  • 3Dコンテキストを失い、計算量が増加するスライディングウィンドウ法の限界を克服すること。
  • グローバルコンテキストを保持しつつ計算効率を維持する、全体ボリュームベースのフレームワークを開発すること。
  • コンテキスト認識特徴学習を用いて、形状・サイズの可変性が著しい臓器のセグメンテーション精度を向上させること。

提案手法

  • 全体ボリュームに基づく粗-細かいセグメンテーションフレームワークを提案し、粗いモデルが臓器の概ねの位置を予測し、その出力をコンテキストとして用いて細かいモデルがそれを精緻化する。
  • 効率的SegNetアーキテクチャは、基本的なエンコーダ、非等方的3D畳み込み(k×k×1 および 1×1×k)を用いたスリムなデコーダ、およびストリッププーリングを用いたコンテキストブロックから構成され、長距離で非等方的なコンテキストを捉える。
  • 非等方的畳み込みは、標準的な3D畳み込みを、インラインスライス(k×k×1)およびインターラインスライス(1×1×k)の演算に分解することで、FLOPsとメモリ使用量を削減する。
  • ストリッププーリングモジュールは、異なる空間次元に沿って細長い長距離プーリングカーネル(1×N×N、N×1×N、N×N×1)を適用し、局所的およびグローバルコンテキストを効率的に統合する。
  • GPUメモリ消費量を削減するために、特徴マップの融合は連結ではなく要素ごとの加算を採用する。
  • モデルはzスコア強度正規化、LPIへの画像回転、および固定サイズ(粗いモデル:160×160×160、細かいモデル:192×192×192)への空間リサンプリングを用いて訓練され、推論はFP16および動的メモリキャッシュを用いる。

実験結果

リサーチクエスチョン

  • RQ1全体ボリュームベースの粗-細かいフレームワークは、計算コストとメモリ使用量を低減しつつ、スライディングウィンドウ法を上回る多臓器セグメンテーション性能を達成できるか?
  • RQ2非等方的畳み込みとストリッププーリングは、最小限のFLOPsで腹部CTボリュームの長距離で空間的に一貫したコンテキストを効果的に捉えることができるか?
  • RQ3提案手法は、多施設・多フェーズ・多ベンダーの多様なデータソースおよび病理的症例に、どの程度一般化可能か?
  • RQ4なぜ膵臓の性能が著しく低下するのか、その背後にある解剖学的要因や画像的要因は何か?

主な発見

  • 本手法は、FLARE2021バリデーションセットにおいて、平均Dice類似係数(DSC)89.65%、平均正規化表面距離(NSD)77.75%を達成し、他の手法を上回った。
  • 健全または軽度の病変を示す臓器(肝臓、腎臓、脾臓)では、DSCが95%を超え、NSDが80%を超えた。これは、強力な一般化性と頑健性を示している。
  • 膵臓セグメンテーションでは顕著に低い性能(DSC:75.3%、NSD:60.5%)を示し、主に高い解剖学的可変性と重度の病変効果に起因する。
  • 平均推論時間は1ケースあたり9.8秒、GPUメモリ使用量はたった1017MBにとどまり、高い効率性を示した。
  • 重度の病変を伴う難易度の高いケース(例:ケース#25)では、膵臓のDSCが13.5%に低下し、極端な解剖学的歪みの処理における限界を浮き彫りにした。
  • 5分割交差検証の結果、各foldで一貫した性能を示し、肝臓・腎臓・脾臓ではDSC >95%、NSD >87%を達成。モデルの安定性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。