[论文解读] Are we using appropriate segmentation metrics? Identifying correlates of human expert perception for CNN training beyond rolling the DICE coefficient
本研究通过展示人类专家对卷积神经网络(CNN)生成的分割结果评分高于人工校对的参考标签,挑战了在医学图像分割中使用标准分割指标(如Dice系数)的合理性。作者提出了一种新颖的统计框架,用于构建更符合专家感知的复合损失函数,揭示了当前指标与临床相关性及专家判断之间的差强人意的相关性,尤其是在胶质母细胞瘤增强肿瘤和灰质等关键结构上。
Metrics optimized in complex machine learning tasks are often selected in an ad-hoc manner. It is unknown how they align with human expert perception. We explore the correlations between established quantitative segmentation quality metrics and qualitative evaluations by professionally trained human raters. Therefore, we conduct psychophysical experiments for two complex biomedical semantic segmentation problems. We discover that current standard metrics and loss functions correlate only moderately with the segmentation quality assessment of experts. Importantly, this effect is particularly pronounced for clinically relevant structures, such as the enhancing tumor compartment of glioma in brain magnetic resonance and grey matter in ultrasound imaging. It is often unclear how to optimize abstract metrics, such as human expert perception, in convolutional neural network (CNN) training. To cope with this challenge, we propose a novel strategy employing techniques of classical statistics to create complementary compound loss functions to better approximate human expert perception. Across all rating experiments, human experts consistently scored computer-generated segmentations better than the human-curated reference labels. Our results, therefore, strongly question many current practices in medical image segmentation and provide meaningful cues for future research.
研究动机与目标
- 调查既定分割指标与医学图像分割中人类专家感知之间的相关性。
- 识别为何标准指标(如Dice系数)无法反映临床相关的分割质量,尤其是对胶质母细胞瘤增强肿瘤和超声图像中灰质等关键结构而言。
- 开发一种新的统计框架,用于构建更贴近人类专家感知的复合损失函数,以在CNN训练过程中实现更优对齐。
- 挑战将人工校对的参考标签视为分割基准中可靠真实标签的假设。
- 提供实证证据表明,当前医学图像分割的评估实践可能因与专家判断不一致而产生误导。
提出的方法
- 通过专业放射科医生开展心理物理学实验,对两种复杂生物医学分割任务中的CNN生成分割与人工校对分割进行质量评分:脑部MRI中的胶质母细胞瘤分割和超声图像中的灰质分割。
- 收集专家评分者对分割质量的定性评价,重点关注解剖准确性、轮廓精确度和临床相关性。
- 应用经典统计技术,将专家感知建模为复合度量,整合形状、空间和基于强度的特征,以构建新的损失函数。
- 通过回归加权方法,将多种分割质量相关因子(如表面距离、体积重叠、形状相似性)组合,形成新颖的复合损失函数。
- 使用所得损失函数训练CNN,并与标准指标及专家评分排名对比评估性能。
- 使用专家评分对比单模型CNN与集成模型相对于人工校对参考标签的相对质量。
实验结果
研究问题
- RQ1标准分割指标(如Dice系数)与医学影像中人类专家对分割质量的感知之间的相关性如何?
- RQ2当前评估指标在多大程度上无法反映临床相关性,尤其是对胶质母细胞瘤增强肿瘤或超声图像中灰质等关键结构而言?
- RQ3能否通过专家评分推导出的复合损失函数,在CNN训练过程中比标准指标更好地逼近人类感知?
- RQ4为何人类专家始终对AI生成的分割结果评分高于人工校对的参考标签?
- RQ5参考标签与专家感知之间的差异在多大程度上可归因于系统性或随机性标注误差?
主要发现
- 在所有实验中,人类专家一致对CNN生成的分割结果评分高于人工校对的参考标签,即使是对单模型预测结果也是如此。
- Dice系数与专家感知的相关性仅中等,尤其在胶质母细胞瘤增强肿瘤和超声图像中灰质等临床关键结构上表现更差。
- 常被视为真实标签的参考标签,其评分反而低于AI生成的分割结果,表明其可能并非可靠的基准。
- 所提出的复合损失函数,基于专家评分的统计建模,相较于标准指标,与专家感知的对齐效果更优。
- 在冠状面视图中,人类与AI分割结果的差异最小,表明标准标注视图可能对人类表现产生偏差。
- 人工标签中的随机与系统性标注误差可能共同导致标准指标与专家感知之间相关性差,而CNN可能通过平均化随机误差而表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。