Skip to main content
QUICK REVIEW

[論文レビュー] AbdomenCT-1K: Is Abdominal Organ Segmentation A Solved Problem?

Jun Ma, Yao Zhang|arXiv (Cornell University)|Oct 28, 2020
COVID-19 diagnosis using AI参考文献 101被引用数 14
ひとこと要約

本稿では、12の病院から収集した1,000例の腹部CTスキャンを含む大規模かつ多様な腹部CTデータセットAbdomenCT-1Kを紹介する。多段階、多ベンダー、多疾患症例を含む。既存のベンチマークで最先端(SOTA)の性能を示すが、臨床的状況の多様性にわたる一般化に失敗する傾向が明らかになった。これにより、完全教師あり、半教師あり、弱教師あり、継続的学習の4つの新しいベンチマークに加え、実臨床課題に対応する強力なオールド・ザ・ボックス型ベースラインが開発された。

ABSTRACT

With the unprecedented developments in deep learning, automatic segmentation of main abdominal organs seems to be a solved problem as state-of-the-art (SOTA) methods have achieved comparable results with inter-rater variability on many benchmark datasets. However, most of the existing abdominal datasets only contain single-center, single-phase, single-vendor, or single-disease cases, and it is unclear whether the excellent performance can generalize on diverse datasets. This paper presents a large and diverse abdominal CT organ segmentation dataset, termed AbdomenCT-1K, with more than 1000 (1K) CT scans from 12 medical centers, including multi-phase, multi-vendor, and multi-disease cases. Furthermore, we conduct a large-scale study for liver, kidney, spleen, and pancreas segmentation and reveal the unsolved segmentation problems of the SOTA methods, such as the limited generalization ability on distinct medical centers, phases, and unseen diseases. To advance the unsolved problems, we further build four organ segmentation benchmarks for fully supervised, semi-supervised, weakly supervised, and continual learning, which are currently challenging and active research topics. Accordingly, we develop a simple and effective method for each benchmark, which can be used as out-of-the-box methods and strong baselines. We believe the AbdomenCT-1K dataset will promote future in-depth research towards clinical applicable abdominal organ segmentation methods. The datasets, codes, and trained models are publicly available at https://github.com/JunMa11/AbdomenCT-1K.

研究の動機と目的

  • 現在の最先端(SOTA)の腹部臓器セグメンテーション深層学習手法が、異なるスキャナ、段階、疾患タイプを含む多様な臨床的状況にうまく一般化できるかどうかを調査すること。
  • 腹部CT画像における実臨床的変動を反映した大規模かつ多様な公開データセットの不足に対処すること。
  • 半教師あり、弱教師あり、継続的学習の設定を含む、アノテーション効率的で頑健なセグメンテーションのための新規ベンチマークの開発と検証すること。
  • 臨床的応用に向けたセグメンテーションシステムの研究を加速するために、各新ベンチマークに対応する強力なオールド・ザ・ボックス型ベースライン手法を提供すること。

提案手法

  • 複数のベンダー、段階(動脈期、門脈静脈期、遅延期)、および疾患タイプ(希少疾患や重度の病理変化を含む)をカバーする12の医療機関から合計1,000例の腹部CTスキャンを収集・整備した。
  • 完全教師あり、半教師あり、弱教師あり、継続的学習の4つの異なるセグメンテーションベンチマークを構築し、それぞれが多様な病院とスキャナからのテストセットを有するようにした。
  • 臨床的意義を捉えるために、領域ベース(Dice類似係数、DSC)と境界ベース(ハウスドルフ距離、NSD)の両方の指標を重視した評価プロトコルを設計した。
  • ラベル不足とドメインシフトに対処するため、データ拡張、カリキュラム学習、および疑似ラベル化戦略を用いた、シンプルだが効果的なベースラインモデルを各ベンチマーク用に開発した。
  • 8つの追加臓器(例:大動脈、胆嚢、副腎)と663例の疑似ラベル化腫瘍を含む追加の50例を統合し、病変レベルのセグメンテーション研究を支援した。
  • 公平な、同じ基準での比較を可能にするために、共通のテストセット(NJUデータセット)50例を用いた。

実験結果

リサーチクエスチョン

  • RQ1トレーニング時に見られなかった、多施設・多段階・多ベンダー・多疾患CTスキャンに、最先端(SOTA)の腹部臓器セグメンテーションモデルが効果的に一般化できるか?
  • RQ2標準ベンチマークをはるかに超える、困難で多様かつ臨床的に現実的なデータ分布において、現在のSOTA手法はどの程度の性能を示すか?
  • RQ3実臨床的データ制約下における、完全教師あり、半教師あり、弱教師あり、継続的学習アプローチの相対的性能とトレードオフは何か?
  • RQ4外科的計画の文脈において、DSCのような領域ベースの指標では捉えきれない限界を、境界関連指標(例:NSD)がどの程度明らかにするか?
  • RQ5半教師ありや継続的学習セグメンテーションのような、新たな臨床的関連性の高いベンチマークに対して、シンプルで効果的なベースラインモデルを開発できるか?

主な発見

  • SOTA手法は標準ベンチマークでは高いDSC(>95%)を達成するが、AbdomenCT-1Kの多様で多施設的かつ多疾患的ケースでテストすると、顕著に性能が低下(DSC低減、NSD上昇)する。
  • ラベル付き41例と未ラベル付き800例を用いた半教師あり手法が、ラベル付き361例を用いた完全教師あり手法とほぼ同等の性能を達成し、優れたデータ効率性を示した。
  • 弱教師あり手法は最低の性能を示したが、最小限のアノテーション作業で実現可能であり、精度とラベリングコストのトレードオフを浮き彫りにした。
  • 継続的学習では、モデルに新しいデータ分布が提示されると、以前に学習したタスク(特に膵臓セグメンテーション)の性能が著しく低下する「壊滅的忘却」が観察された。
  • 肝臓セグメンテーションはDSCとNSDの分布がきわめて安定しており、最も一貫性のある性能を示したが、膵臓セグメンテーションは病理的多様性のため、スコアが低く境界誤差も高かった。
  • 共通のテストセットにより、完全教師あり手法が平均DSCとNSDで最高の性能を示したが、半教師あり手法は性能とアノテーション効率のバランスに優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。