Skip to main content
QUICK REVIEW

[论文解读] Basic Ensembles of Vanilla-Style Deep Learning Models Improve Liver Segmentation From CT Images

A. Emre Kavur, Ludmila I. Kuncheva|arXiv (Cornell University)|Jan 27, 2020
Advanced Neural Network Applications被引用 7
一句话总结

本研究提出了一种简单、可复现的集成方法,用于从CT扫描中进行肝脏分割,使用现成的深度学习模型(U-Net、Deepmedic、V-Net、Dense V-Net)且无需超参数调优。通过采用基本的非训练规则(多数投票、平均、乘积、最小/最大值)组合其预测结果,该集成方法在两个公开数据集上显著优于单个模型,其中平均组合器表现最佳。

ABSTRACT

Segmentation of the liver from 3D computer tomography (CT) images is one of the most frequently performed operations in medical image analysis. In the past decade, Deep Learning Models (DMs) have offered significant improvements over previous methods for liver segmentation. The success of DMs is usually owed to the user's expertise in deep learning as well as to intricate training procedures. The need for bespoke expertise limits the reproducibility of empirical studies involving DMs. Today's consensus is that an ensemble of DMs works better than the individual component DMs. In this study we set off to explore the potential of ensembles of publicly available, `vanilla-style' DM segmenters Our ensembles were created from four off-the-shelf DMs: U-Net, Deepmedic, V-Net, and Dense V-Networks. To prevent further overfitting and to keep the overall model simple, we use basic non-trainable ensemble combiners: majority vote, average, product and min/max. Our results with two publicly available data sets (CHAOS and 3Dircadb1) demonstrate that ensembles are significantly better than the individual segmenters on four widely used metrics.

研究动机与目标

  • 为解决基于深度学习的医学图像分割中的可复现性危机,避免自定义模型设计和大量超参数调优。
  • 评估是否仅使用公开可用、默认配置的深度学习模型组成的简单集成,能够在肝脏分割任务中超越单个模型。
  • 识别在易发生过拟合的小型医学影像数据集中,最有效的非训练集成组合器。
  • 为缺乏深度学习专业知识的从业者提供即用型、低投入的解决方案,提升医学AI研究中的可复现性。

提出的方法

  • 选取了四种最先进的公开可用深度学习模型:U-Net、Deepmedic、V-Net和Dense V-Net,均使用其默认超参数和网络结构进行训练。
  • 应用了四种非训练集成组合器:多数投票、平均、乘积以及最小/最大值,用于组合基础模型的分割输出。
  • 使用两个公开数据集——CHAOS和3Dircadb1——进行评估,确保在基准数据上的一致性和可复现性。
  • 采用四种标准指标评估性能:DICE、HD95、HD和HD95(DICE值取反以保持优化一致性)。
  • 避免对组合器进行模型校准或额外训练,以保持方法简洁性,并防止在小样本数据集上发生过拟合。
  • 在所有指标和数据集上,将集成性能与单个模型进行对比,以评估相对提升和鲁棒性。

实验结果

研究问题

  • RQ1是否能够通过仅使用现成的深度学习模型组成的简单集成,在无需任何模型特定调优的情况下,超越单个模型在CT图像肝脏分割中的表现?
  • RQ2在多种指标和数据集上,哪种非训练集成组合器(多数投票、平均、乘积、最小/最大值)能实现最一致且优越的性能?
  • RQ3与使用默认设置训练的单个深度学习模型相比,所提出的简单集成方法是否能有效缓解小型医学影像数据集中的过拟合问题?
  • RQ4单个模型输出中的校准问题在多大程度上影响集成性能?在不进行校准的情况下,简单组合器是否仍能产生稳健结果?
  • RQ5该集成方法是否可作为医学图像分割的可复现、低投入基线,避免自定义模型设计和大量超参数调优?

主要发现

  • 在CHAOS和3Dircadb1两个数据集上,所有四种评估指标下,该简单集成方法均显著优于所有单个模型。
  • 平均组合器整体表现最佳,在所有数据集、指标和基础模型的32种可能比较中,赢得了25场胜利(胜场减去负场)。
  • 在CHAOS数据集上,多数投票集成表现最佳;而在两个数据集整体上,平均组合器为最优。
  • 乘积和最小/最大值组合器表现具有竞争力,但在总胜场数和一致性方面仍逊于平均组合器。
  • 结果表明,过拟合是小型医学数据集中的主要问题,而简单集成方法相比使用默认设置训练的单个模型,能更有效地降低此风险。
  • 经过训练的组合器(如加权多数投票、朴素贝叶斯和行为知识空间BKS)性能与简单组合器相当,进一步说明在小样本数据集上,增加复杂性并不能提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。