[论文解读] Normalization in Training U-Net for 2D Biomedical Semantic Segmentation
本论文评估了四种归一化技术——批归一化(BN)、实例归一化(IN)、层归一化(LN)和组归一化(GN)——在2D生物医学语义分割U-Net训练中的表现。研究发现,与BN相比,大组数的GN或IN能更有效地提升模型的泛化能力和分割精度,尤其是在小批量或患者特异性数据上,这是由于其对医学影像中内部协变量偏移的处理更为优越。
2D biomedical semantic segmentation is important for robotic vision in surgery. Segmentation methods based on Deep Convolutional Neural Network (DCNN) can out-perform conventional methods in terms of both accuracy and levels of automation. One common issue in training a DCNN for biomedical semantic segmentation is the internal covariate shift where the training of convolutional kernels is encumbered by the distribution change of input features, hence both the training speed and performance are decreased. Batch Normalization (BN) is the first proposed method for addressing internal covariate shift and is widely used. Instance Normalization (IN) and Layer Normalization (LN) have also been proposed. Group Normalization (GN) is proposed more recently and has not yet been applied to 2D biomedical semantic segmentation, however, no specific validations on GN were given. Most DCNNs for biomedical semantic segmentation adopt BN as the normalization method by default, without reviewing its performance. In this paper, four normalization methods - BN, IN, LN and GN are compared in details, specifically for 2D biomedical semantic segmentation. U-Net is adopted as the basic DCNN structure. Three datasets regarding the Right Ventricle (RV), aorta, and Left Ventricle (LV) are used for the validation. The results show that detailed subdivision of the feature map, i.e. GN with a large group number or IN, achieves higher accuracy. This accuracy improvement mainly comes from better model generalization. Codes are uploaded and maintained at Xiao-Yun Zhou's Github.
研究动机与目标
- 探究不同归一化技术对U-Net在2D生物医学语义分割训练中的影响。
- 解决医学图像分割中因训练过程中特征分布偏移而导致模型性能下降的内部协变量偏移挑战。
- 评估GN、IN和LN等替代归一化方法是否在分割精度和泛化能力方面优于广泛使用的批归一化(BN)。
- 在不同解剖结构(RV、主动脉、LV)及具有不同强度分布的患者特异性数据上,验证归一化方法的有效性。
- 通过识别提升泛化与鲁棒性的最优策略,为未来医学图像深度学习中归一化层的设计提供指导。
提出的方法
- 在U-Net中使用四种归一化方法进行训练:批归一化(BN)、实例归一化(IN)、层归一化(LN)以及不同组数的组归一化(GN4、GN8、GN16)。
- 在U-Net编码器和解码器的每个卷积层后应用归一化,以稳定特征分布并减少内部协变量偏移。
- 使用三个公开的2D心脏MRI/CT数据集(分别用于右心室(RV)、主动脉和左心室(LV)分割)来评估不同解剖结构下的性能表现。
- 以Dice相似性系数(DSC)为主要指标评估模型性能,并通过多次独立训练以评估稳定性和泛化能力。
- 通过比较推理过程中使用训练时统计量(TrainI)和测试时统计量(TestI)的BN行为,评估在分布偏移下的鲁棒性。
- 对小批量大小的影响及不同归一化方法在多个随机种子下的性能进行消融研究,以评估训练稳定性。
实验结果
研究问题
- RQ1在使用U-Net进行2D生物医学语义分割时,高组数的组归一化(GN)或实例归一化(IN)是否优于批归一化(BN)?
- RQ2不同归一化方法如何影响模型的泛化能力,特别是在具有不同图像强度分布的患者特异性数据上?
- RQ3小批量大小对U-Net训练中归一化技术性能有何影响?
- RQ4在推理阶段使用测试时统计量(TestI)而非训练时统计量(TrainI)是否能提升BN在医学分割任务中的表现?
- RQ5归一化技术能否缓解在从零开始训练的深度U-Net架构中,医学图像训练时内部协变量偏移带来的负面影响?
主要发现
- 组归一化(GN)采用大组数(如GN16)在主动脉数据集上取得了最高的平均DSC(0.8091),优于BN(0.8274)和LN(0.8189)在左心室数据集上的表现。
- 实例归一化(IN)在右心室(RV)数据集上取得了0.7035的平均DSC,显著优于BN(0.6436),并在该具有挑战性的低对比度结构中表现最佳。
- 归一化方法,尤其是GN和IN,在初始精度较低的患者中(如RV的患者31,主动脉的患者15)显著提升了分割精度,表明其泛化能力更强。
- 六次独立训练运行的标准差中,LN最高(0.0562),GN8最低(0.0097),表明中等组数的GN具有更好的训练稳定性。
- 小批量大小在分割精度上优于大批次大小,表明BN在医学影像中的性能对批量大小敏感。
- 在推理阶段使用测试时统计量(TestI)而非训练时统计量(TrainI)可提升BN性能,表明BN的统计量对批量分布偏移敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。