Skip to main content
QUICK REVIEW

[論文レビュー] A multi-scale pyramid of 3D fully convolutional networks for abdominal multi-organ segmentation

Holger R. Roth, Chen Shen|arXiv (Cornell University)|Jun 6, 2018
Radiomics and Machine Learning in Medical Imaging参考文献 13被引用数 7
ひとこと要約

本稿では、自己文脈融合を用いた3次元畳み込みネットワーク(FCN)のマルチスケールピラミッドを提案し、高解像度で文脈に配慮した腹部多臓器セグメンテーションを実現する。複数スケールの3次元U-Netに類似したFCNをスタックし、エンドツーエンド学習を適用することで、臨床的CTデータセット上で平均Diceスコア89.0%を達成し、異なる病院や公開ベンチマークからの未学習データに対しても強力な汎化性能を示した。

ABSTRACT

Recent advances in deep learning, like 3D fully convolutional networks (FCNs), have improved the state-of-the-art in dense semantic segmentation of medical images. However, most network architectures require severely downsampling or cropping the images to meet the memory limitations of today's GPU cards while still considering enough context in the images for accurate segmentation. In this work, we propose a novel approach that utilizes auto-context to perform semantic segmentation at higher resolutions in a multi-scale pyramid of stacked 3D FCNs. We train and validate our models on a dataset of manually annotated abdominal organs and vessels from 377 clinical CT images used in gastric surgery, and achieve promising results with close to 90% Dice score on average. For additional evaluation, we perform separate testing on datasets from different sources and achieve competitive results, illustrating the robustness of the model and approach.

研究の動機と目的

  • 3次元医療画像セグメンテーションにおけるGPUメモリ制限の課題に対処し、過度なクロッピングやダウンサンプリングを回避して高解像度推論を可能にすること。
  • 細かい構造(血管や小器官など)のセグメンテーション精度を向上させるために、マルチスケールの文脈的情報を統合すること。
  • 自己文脈を用いてスケール間の特徴を統合するエンドツーエンドで学習可能なフレームワークを構築し、高解像度での特徴表現を強化すること。
  • 異なる病院や公開ソースからの未学習データセットにおける汎化性能を評価し、画像変動に強い性能を示すこと。

提案手法

  • 本手法は、低解像度特徴マップをアップサンプリングし、高解像度入力と連結することで文脈を豊かにするマルチスケールピラミッド型3次元FCNを採用する。
  • ピラミッドの各レベルでは、3×3×3畳み込み、ReLU活性化関数、2×2×2のマックスプーリングを用いた3次元U-Netに類似したアーキテクチャを採用する。
  • 自己文脈は、粗いスケールからのアップサンプリング予測を、細かいスケールのネットワークへの追加入力特徴として連結することで実装され、文脈に配慮した精緻化が可能になる。
  • 各ピラミッドレベルでDice損失を用いてエンドツーエンド学習を実施し、マルチスケール特徴と予測の共同最適化を可能にする。
  • ネットワークは元の解像度の1/4~1/2の解像度で画像を処理し、計算効率と性能のバランスをとる。
  • スケール間の特徴統合はスキップ接続と連結によって実現され、空間的詳細を保持するとともにグローバルな文脈を統合する。

実験結果

リサーチクエスチョン

  • RQ1自己文脈統合を施したマルチスケール3次元FCNピラミッドは、標準的な3次元FCNと比較して、腹部臓器や血管のセグメンテーション精度を向上させることができるか?
  • RQ2文脈注入を施したマルチスケール3次元FCNのエンドツーエンド学習は、分離学習や文脈なしアーキテクチャと比較して、より優れた性能を発揮するか?
  • RQ3本手法は、異なる病院や画像プロトコルから得た未学習データセットに対し、どのように汎化するか?
  • RQ4腹部セグメンテーションに適したマルチスケール3次元FCN設計において、解像度と計算コストの最適なトレードオフは何か?
  • RQ5粗いスケールの文脈統合は、血管や胆嚢のような微細または複雑な構造の細粒度セグメンテーションを顕著に改善できるか?

主な発見

  • 提案されたエンドツーエンドのマルチスケール3次元FCNは、377例の臨床的CTスキャンから成る主なトレーニングおよび検証データセットで平均Diceスコア89.0%を達成した。
  • 別の病院の未学習テストセットでは、平均Diceスコア86.3%を達成し、強力な汎化性能と耐障害性を示した。
  • 最先端手法[7](平均Dice 80.3%)および[9](平均Dice 65.0%)を上回り、特に肝臓、脾臓、胃のセグメンテーションで優れた性能を示した。
  • 自己文脈機構により、特に血管のセグメンテーションが顕著に向上した。視覚的比較では、2番目のレベルの予測がより完全な血管構造を捉えていた。
  • 粗いスケールの入力(4倍ダウンサンプリング)を用いることで顕著な性能向上が得られたが、より高解像度の最終レベルでは利得の逓減が見られた。
  • 公開のVisceralデータセットでは、再トレーニングなしで平均Diceスコア77.8%を達成し、同じ臓器セットについてのチャレンジリーダーボード上位の78.8%を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。