[论文解读] Impact of individual rater style on deep learning uncertainty in medical imaging segmentation
本研究探讨了个别评分者风格——特别是偏差和一致性——对医学图像分割中深度学习不确定性的影响。基于两个公开的MRI数据集(MS病灶和脊髓灰质体),研究发现评分者偏差与模型不确定性之间存在强烈相关性(R² = 0.60 和 0.93),且多中心共识标注比单中心共识更能有效降低不确定性,原因在于中心特有的评分者风格模式。
While multiple studies have explored the relation between inter-rater variability and deep learning model uncertainty in medical segmentation tasks, little is known about the impact of individual rater style. This study quantifies rater style in the form of bias and consistency and explores their impacts when used to train deep learning models. Two multi-rater public datasets were used, consisting of brain multiple sclerosis lesion and spinal cord grey matter segmentation. On both datasets, results show a correlation ($R^2 = 0.60$ and $0.93$) between rater bias and deep learning uncertainty. The impact of label fusion between raters' annotations on this relationship is also explored, and we show that multi-center consensuses are more effective than single-center consensuses to reduce uncertainty, since rater style is mostly center-specific.
研究动机与目标
- 探讨个体评分者风格(特别是偏差与一致性)对医学图像分割中深度学习模型不确定性的影响。
- 将评分者偏差量化为评分者分割与共识分割之间病灶体积偏差的平均值,将评分者一致性量化为该偏差在图像间标准差。
- 评估标签融合策略(单中心 vs. 多中心共识)对评分者风格与模型不确定性之间关系的影响。
- 确定评分者风格指标是否可用于改进模型训练或不确定性报告,从而潜在提升分割性能与可靠性。
提出的方法
- 将评分者偏差定义为在所有图像中,评分者分割与共识分割之间正voxel数量差异的平均绝对值。
- 将评分者一致性定义为评分者分割与共识分割之间差异的标准差,并以评分者的偏差为中心进行标准化。
- 使用多数投票法在评分者之间生成共识分割,作为基准参考。
- 基于单个评分者的标注训练深度学习模型,并通过预测方差或熵来测量其不确定性。
- 比较绝对偏差(基于体积)与相对偏差(以共识体积归一化)以评估对病灶大小的敏感性。
- 通过比较使用单中心与多中心共识作为训练目标时的不确定性,评估标签融合的影响。
实验结果
研究问题
- RQ1个体评分者偏差是否与医学图像分割中深度学习模型的不确定性相关?
- RQ2评分者一致性如何影响模型不确定性,且是否为显著预测因子?
- RQ3标签融合策略的选择(单中心 vs. 多中心共识)是否影响偏差-不确定性关系的强度?
- RQ4相对于绝对偏差,以共识体积归一化的相对偏差是否更有效地捕捉评分者风格对不确定性的效应?
- RQ5评分者风格指标是否可用于改进模型不确定性估计或指导医学分割任务中的数据整理?
主要发现
- 在MS病灶数据集中,评分者偏差与深度学习模型不确定性之间存在强烈相关性,R² = 0.60;在脊髓灰质体数据集中,R² = 0.93。
- 当使用相对偏差(以共识体积归一化)时,偏差与不确定性的关系依然显著,R² = 0.64(MS)和R² = 0.93(GM),表明对病灶大小变化具有鲁棒性。
- 多中心共识标签融合比单中心共识更有效地降低模型不确定性,因为评分者风格模式主要具有中心特异性。
- 在MS病灶数据集中,相对偏差比绝对偏差更清晰地识别出异常评分者,表明相对指标能更敏感地捕捉小病灶误差。
- 脊髓灰质体数据集整体偏差较低,且绝对偏差与相对偏差之间差异较小,可能由于评分者间一致性较高且病灶大小变异较小。
- 结果表明,评分者风格(尤其是偏差)可作为先验知识,用于优化模型训练或不确定性估计,从而潜在提升分割的可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。