Skip to main content
QUICK REVIEW

[論文レビュー] A-Eval: A Benchmark for Cross-Dataset Evaluation of Abdominal Multi-Organ Segmentation

Ziyan Huang, Zhongying Deng|arXiv (Cornell University)|Sep 7, 2023
Colorectal Cancer Screening and Detection被引用数 6
ひとこと要約

本稿では、FLARE22、AMOS、WORD、TotalSegmentatorの4つの大規模データセットの学習データを用いて、腹部多臓器セグメンテーションモデルのクロスデータセット評価を目的としたA-Evalを紹介する。評価はこれらの検証セットに加え、BTCVの学習セットを含む。主な貢献は、共同学習、偽ラベル付け、マルチモodal学習が一般化性能を顕著に向上させることを示したことであり、モデルサイズの増大は特定の点を過ぎると限界効果に陥ることを明らかにした。

ABSTRACT

Although deep learning have revolutionized abdominal multi-organ segmentation, models often struggle with generalization due to training on small, specific datasets. With the recent emergence of large-scale datasets, some important questions arise: extbf{Can models trained on these datasets generalize well on different ones? If yes/no, how to further improve their generalizability?} To address these questions, we introduce A-Eval, a benchmark for the cross-dataset Evaluation ('Eval') of Abdominal ('A') multi-organ segmentation. We employ training sets from four large-scale public datasets: FLARE22, AMOS, WORD, and TotalSegmentator, each providing extensive labels for abdominal multi-organ segmentation. For evaluation, we incorporate the validation sets from these datasets along with the training set from the BTCV dataset, forming a robust benchmark comprising five distinct datasets. We evaluate the generalizability of various models using the A-Eval benchmark, with a focus on diverse data usage scenarios: training on individual datasets independently, utilizing unlabeled data via pseudo-labeling, mixing different modalities, and joint training across all available datasets. Additionally, we explore the impact of model sizes on cross-dataset generalizability. Through these analyses, we underline the importance of effective data usage in enhancing models' generalization capabilities, offering valuable insights for assembling large-scale datasets and improving training strategies. The code and pre-trained models are available at \href{https://github.com/uni-medical/A-Eval}{https://github.com/uni-medical/A-Eval}.

研究の動機と目的

  • 異なる腹部多臓器セグメンテーションデータセット間でのモデル一般化性能の標準化された評価の欠如に対処すること。
  • 共同学習、偽ラベル付け、マルチモーダル学習などのデータ利用戦略が、未学習のデータセットにおけるモデル性能に与える影響を調査すること。
  • モデルサイズが腹部臓器セグメンテーションにおけるクロスデータセット一般化に与える影響を評価すること。
  • 単一データセットの性能を超えて、公平かつ包括的な評価が可能な統一ベンチマークを提供すること。

提案手法

  • FLARE22、AMOS、WORD、TotalSegmentatorの4つの大規模な公開データセットの公式学習セットを用いてベンチマークを構築する。
  • これらの4つのデータセットの検証セットとBTCVの学習セットを組み合わせて、5つの異なるデータセットから成る多様な評価セットを構成する。
  • 個々のデータセットでの学習、未ラベルデータの偽ラベル付け、CT/MRのモダリティミキシング、およびすべてのデータセットを統合した共同学習といった複数の戦略を用いてモデルを学習・評価する。
  • 8つの共有臓器カテゴリにおいて、Dice類似係数(DSC)と正規化表面Dice(NSD)を用いてモデル性能を評価する。
  • モデルサイズの異なるバリエーション(STU-Net-S、-B、-L、-H)を系統立てて比較し、モデル容量が一般化性能に与える影響を分析する。
  • 各モデルバージョンについて20回のクロスデータセット評価を実施し、平均DSCおよびNSDと標準偏差を算出することで、安定性と一般化性能を評価する。
Figure 1 : Comparison of the original evaluation approach versus our proposed A-Eval benchmark for assessing model generalizability. (a) Original evaluation involves training and testing on the same dataset, providing good results but leaving uncertainty when applied to other datasets. (b) A-Eval, o
Figure 1 : Comparison of the original evaluation approach versus our proposed A-Eval benchmark for assessing model generalizability. (a) Original evaluation involves training and testing on the same dataset, providing good results but leaving uncertainty when applied to other datasets. (b) A-Eval, o

実験結果

リサーチクエスチョン

  • RQ1大規模な腹部セグメンテーションデータセットで学習したモデルは、異なる画像撮影プロトコルやアノテーションを持つ他のデータセットに対しても効果的に一般化できるか?
  • RQ2共同学習、偽ラベル付け、マルチモーダル学習などの異なるデータ利用戦略が、クロスデータセット一般化性能に与える影響は何か?
  • RQ3多様な腹部データセットにおいて、モデルサイズの増大が一般化性能に与える影響は何か?
  • RQ4モデル容量の増大は常に一般化性能の向上をもたらすのか、それとも限界効果に達する点があるのか?

主な発見

  • FLARE22、AMOS、WORD、TotalSegmentatorの4つの大規模データセットを統合して学習した結果、BTCVデータセットにおいて平均DSC 93.81%、NSD 93.81%を達成し、個別データセットでの学習を上回った。
  • 偽ラベル付けにより、FLARE22のみで学習した場合の平均DSC 89.28%から90.94%に向上し、未ラベルデータの活用価値が示された。
  • AMOSのCTおよびMRデータを用いたマルチモーダル学習により、平均DSCは91.65%から92.53%に向上し、モダリティの多様性が一般化性能を向上させることを示した。
  • より大きなモデル(STU-Net-L)は、より高い平均DSC(86.64%)とNSD(90.14%)を達成したが、最大のモデル(STU-Net-H)ではさらなる向上が見られず、飽和点に達したことが示唆された。
  • STU-Net-Hモデルは平均DSC 86.16%、NSD 89.95%を記録し、STU-Net-Lモデルをわずかに下回った。これは、極端なスケールでの過学習または非効率性の可能性を示唆した。
  • ベンチマークの結果から、データ中心の戦略、特に共同学習とデータ拡張が、モデルサイズの増大のみに比べて、一般化性能の向上により顕著な効果をもたらすことが明らかになった。
Figure 2 : Visualization of the performance of STU-Net-L models trained individually on different datasets (FLARE22 [ 24 ] , AMOS CT [ 16 ] , AMOS MR [ 16 ] , WORD [ 21 ] , TotalSegmentator [ 42 ] ) and validated on multiple datasets (FLARE22 [ 24 ] , AMOS CT [ 16 ] , AMOS MR [ 16 ] , WORD [ 21 ] ,
Figure 2 : Visualization of the performance of STU-Net-L models trained individually on different datasets (FLARE22 [ 24 ] , AMOS CT [ 16 ] , AMOS MR [ 16 ] , WORD [ 21 ] , TotalSegmentator [ 42 ] ) and validated on multiple datasets (FLARE22 [ 24 ] , AMOS CT [ 16 ] , AMOS MR [ 16 ] , WORD [ 21 ] ,

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。