[论文解读] Crowd disagreement about medical images is informative
本研究调查了医学图像标注中群体意见分歧是否包含可用于诊断的预测信息。基于ISIC 2017数据集中的皮肤病变图像,研究发现尽管平均标注(共识)的分类性能最佳(AUC 0.99),但群体标注的标准差及其他分布矩仍具有优于随机猜测的预测能力(AUC 0.71–0.73),表明分歧信息具有价值,不应在机器学习流程中被丢弃。
Classifiers for medical image analysis are often trained with a single consensus label, based on combining labels given by experts or crowds. However, disagreement between annotators may be informative, and thus removing it may not be the best strategy. As a proof of concept, we predict whether a skin lesion from the ISIC 2017 dataset is a melanoma or not, based on crowd annotations of visual characteristics of that lesion. We compare using the mean annotations, illustrating consensus, to standard deviations and other distribution moments, illustrating disagreement. We show that the mean annotations perform best, but that the disagreement measures are still informative. We also make the crowd annotations used in this paper available at \url{https://figshare.com/s/5cbbce14647b66286544}.
研究动机与目标
- 调查皮肤病变图像的群体标注分歧是否包含用于黑色素瘤诊断的预测信号。
- 比较基于共识的特征(均值)与基于分歧的特征(标准差、偏度、峰度)在分类黑色素瘤中的表现。
- 评估将群体标注的分布矩纳入模型是否可提升皮肤病变诊断的机器学习模型性能。
- 探索利用众包视觉特征标注作为医学图像分类辅助信号的可行性。
提出的方法
- 在一项学生项目中,从每张图像的6名标注者处收集了皮肤病变特征(不对称性、边界、颜色、皮肤镜结构、蓝色光芒)的视觉评估。
- 在去除缺失值的图像后,使用ISIC 2017数据集中的96张图像,共获得30个特征(5种特征类型 × 6名标注者)。
- 将每个特征标准化为零均值和单位方差,并应用主成分分析以可视化数据结构。
- 采用10折交叉验证训练逻辑回归分类器,以ROC曲线下面积(AUC)作为评估指标。
- 比较使用全部30个特征、仅使用均值,以及仅使用每类特征的高阶分布矩(标准差、偏度、峰度)的性能。
- 分别分析黑色素瘤和非黑色素瘤类别中分歧度量(如标准差)的分布,以理解其诊断相关性。
实验结果
研究问题
- RQ1群体对皮肤病变视觉特征的标注能否比随机猜测更准确地预测黑色素瘤状态?
- RQ2共识(标注的均值)是否优于分歧(标准差、偏度、峰度)在预测黑色素瘤诊断中的表现?
- RQ3群体标注的变异性中是否存在统计上显著的信号,可为分类提供超越均值的贡献?
- RQ4不同视觉特征(如颜色、边界、皮肤镜结构)如何分别影响共识与分歧度量的预测能力?
主要发现
- 群体标注的均值实现了最高的分类性能,平均AUC为0.99,表明共识在预测中为最优。
- 标注的标准差实现了平均AUC为0.71,显著优于随机猜测,表明分歧信息具有预测价值。
- 标注的偏度实现了平均AUC为0.73,进一步证实群体响应中非正态分布模式携带诊断信号。
- 颜色是单个最具信息量的特征类型,单独使用时平均AUC达0.93,其次为边界(0.82)和皮肤镜结构(0.81)。
- 对于大多数特征类型,非黑色素瘤病例的标准差更高(分歧更大),表明黑色素瘤病变在判断为异常时更具一致性。
- 分歧特征的性能在不同折之间波动较大,表明尽管信号存在,但其表现不稳定,可能在某些情况下损害模型性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。