[论文解读] A-Eval: A Benchmark for Cross-Dataset Evaluation of Abdominal Multi-Organ Segmentation
本文提出 A-Eval,一个用于腹部多器官分割模型跨数据集评估的基准,使用来自四个大规模数据集——FLARE22、AMOS、WORD 和 TotalSegmentator——的训练数据,并在它们的验证集以及 BTCV 的训练集上进行评估。主要贡献在于证明了联合训练、伪标签法和多模态学习能显著提升模型的泛化能力,而模型规模的增加在达到某一临界点后收益递减。
Although deep learning have revolutionized abdominal multi-organ segmentation, models often struggle with generalization due to training on small, specific datasets. With the recent emergence of large-scale datasets, some important questions arise: extbf{Can models trained on these datasets generalize well on different ones? If yes/no, how to further improve their generalizability?} To address these questions, we introduce A-Eval, a benchmark for the cross-dataset Evaluation ('Eval') of Abdominal ('A') multi-organ segmentation. We employ training sets from four large-scale public datasets: FLARE22, AMOS, WORD, and TotalSegmentator, each providing extensive labels for abdominal multi-organ segmentation. For evaluation, we incorporate the validation sets from these datasets along with the training set from the BTCV dataset, forming a robust benchmark comprising five distinct datasets. We evaluate the generalizability of various models using the A-Eval benchmark, with a focus on diverse data usage scenarios: training on individual datasets independently, utilizing unlabeled data via pseudo-labeling, mixing different modalities, and joint training across all available datasets. Additionally, we explore the impact of model sizes on cross-dataset generalizability. Through these analyses, we underline the importance of effective data usage in enhancing models' generalization capabilities, offering valuable insights for assembling large-scale datasets and improving training strategies. The code and pre-trained models are available at \href{https://github.com/uni-medical/A-Eval}{https://github.com/uni-medical/A-Eval}.
研究动机与目标
- 为解决当前缺乏对不同腹部多器官分割数据集之间模型泛化能力的标准化评估问题。
- 探究数据使用策略(如联合训练、伪标签法和多模态学习)对模型在未见数据集上性能的影响。
- 评估模型规模对腹部器官分割中跨数据集泛化能力的影响。
- 提供一个统一的基准,实现对分割模型的公平且全面的评估,超越单一数据集的表现。
提出的方法
- 使用四个大规模公开数据集(FLARE22、AMOS、WORD 和 TotalSegmentator)的官方训练集构建基准。
- 利用这四个数据集的验证集以及 BTCV 的训练集,组成包含五个不同数据集的多样化评估集。
- 采用多种策略进行模型训练与评估:单个数据集训练、未标注数据的伪标签法、模态混合(CT/MR)以及在所有数据集上的联合训练。
- 使用 Dice 相似性系数(DSC)和归一化表面 Dice(NSD)在八个共享器官类别上评估模型性能。
- 系统比较不同规模的模型(STU-Net-S、-B、-L、-H),分析模型容量对泛化能力的影响。
- 每种模型变体进行 20 次跨数据集评估,计算平均 DSC 和 NSD 及其标准差,以评估稳定性与泛化能力。

实验结果
研究问题
- RQ1在大规模腹部分割数据集上训练的模型,能否有效泛化到具有不同成像协议和标注方式的其他数据集?
- RQ2不同的数据使用策略(如联合训练、伪标签法和多模态学习)如何影响模型的跨数据集泛化能力?
- RQ3模型规模对在多样化腹部数据集上的泛化性能有何影响?
- RQ4增加模型容量是否总是带来泛化性能的提升,还是存在收益递减的临界点?
主要发现
- 在所有四个大规模数据集(FLARE22、AMOS、WORD、TotalSegmentator)上进行联合训练,在 BTCV 数据集上实现了最高的平均 DSC(93.81%)和 NSD(93.81%),优于单个数据集的训练方法。
- 伪标签法将平均 DSC 从 89.28%(仅使用 FLARE22)提升至 90.94%,证明了利用未标注数据的价值。
- 在 AMOS 的 CT 和 MR 数据上进行多模态训练,将平均 DSC 从 91.65% 提升至 92.53%,表明模态多样性可增强泛化能力。
- 更大的模型(STU-Net-L)实现了比小型变体更高的平均 DSC(86.64%)和 NSD(90.14%),但最大模型(STU-Net-H)未见进一步提升,表明存在性能饱和点。
- STU-Net-H 模型实现了平均 DSC 86.16% 和 NSD 89.95%,略低于 STU-Net-L 模型,提示在极端规模下可能出现过拟合或效率下降。
- 该基准揭示,以数据为中心的策略——尤其是联合训练和数据增强——带来的泛化能力提升,超过单纯增加模型规模的效果。
![Figure 2 : Visualization of the performance of STU-Net-L models trained individually on different datasets (FLARE22 [ 24 ] , AMOS CT [ 16 ] , AMOS MR [ 16 ] , WORD [ 21 ] , TotalSegmentator [ 42 ] ) and validated on multiple datasets (FLARE22 [ 24 ] , AMOS CT [ 16 ] , AMOS MR [ 16 ] , WORD [ 21 ] ,](https://ar5iv.labs.arxiv.org/html/2309.03906/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。