[论文解读] Visual Diagnosis of Dermatological Disorders: Human and Machine Performance
本文比较了人类与机器在使用临床和皮肤镜图像诊断皮肤疾病时的表现,发现近期的机器学习模型在远程皮肤科诊疗环境中可达到与皮肤科医生相当的诊断准确率,尽管在真实世界图像质量和人群多样性挑战下性能显著下降。
Skin conditions are a global health concern, ranking the fourth highest cause of nonfatal disease burden when measured as years lost due to disability. As diagnosing, or classifying, skin diseases can help determine effective treatment, dermatologists have extensively researched how to diagnose conditions from a patient's history and the lesion's visual appearance. Computer vision researchers are attempting to encode this diagnostic ability into machines, and several recent studies report machine level performance comparable with dermatologists. This report reviews machine approaches to classify skin images and consider their performance when compared to human dermatologists. Following an overview of common image modalities, dermatologists' diagnostic approaches and common tasks, and publicly available datasets, we discuss approaches to machine skin lesion classification. We then review works that directly compare human and machine performance. Finally, this report addresses the limitations and sources of errors in image-based skin disease diagnosis, applicable to both machines and dermatologists in a teledermatology setting.
研究动机与目标
- 评估并比较皮肤科医生与机器学习模型在使用临床和皮肤镜图像分类皮肤病变方面的诊断表现。
- 识别影响人类与机器诊断的关键限制因素,包括图像质量、患者病史整合以及数据集可迁移性。
- 评估机器学习系统是否能在真实世界的远程皮肤科应用中实现人类水平的诊断准确率。
- 研究非视觉患者数据(例如年龄、地点、家族史)对人类与机器诊断表现的影响。
- 突出图像基础皮肤疾病诊断中影响临床与自动化系统的误差与变异来源。
提出的方法
- 系统性回顾机器学习方法在使用临床与皮肤镜图像进行皮肤病变分类中的应用。
- 分析公开数据集(如 Derm750、ISIC 和 Dermofit),重点关注图像采集协议与标注质量。
- 评估在皮肤病变图像上训练的深度学习模型,性能指标包括准确率、AUC 与 top-5 错误率。
- 通过静态图像比较皮肤科医生在面对面与远程皮肤科诊疗环境下的表现。
- 研究非视觉患者数据(如年龄、性别、病变位置)在提升人类与机器诊断准确率中的作用。
- 评估模型在不同人群与成像协议之间的可迁移性,尤其关注不同种族与成像标准之间的表现。
实验结果
研究问题
- RQ1机器学习模型在使用临床与皮肤镜图像分类皮肤病变时,能否达到与人类皮肤科医生相当的诊断准确率?
- RQ2面对面诊疗与使用静态图像的远程皮肤科诊疗在诊断表现上存在哪些差异?
- RQ3非视觉患者数据(如年龄、性别、病变位置)对皮肤科医生与机器模型诊断准确率的影响如何?
- RQ4不同人群间皮肤病变外观的差异在多大程度上影响训练后机器学习模型的可迁移性与泛化能力?
- RQ5图像基础皮肤疾病诊断中的主要误差来源是什么?这些误差如何影响人类与机器的表现?
主要发现
- 在受控的远程皮肤科诊疗环境中,机器学习模型可达到与皮肤科医生相当的诊断准确率,部分研究显示其表现与专家皮肤科医生仅相差 1–2%。
- 与面对面诊疗相比,皮肤科医生在远程皮肤科诊疗中的诊断准确率显著下降,39% 的病例因图像质量不足而无法诊断。
- 在某一人群(如亚洲人群)上训练的机器模型在另一人群(如欧洲人群)上测试时准确率下降至 55.7%,表明跨人群可迁移性较差。
- 非视觉患者数据可提升经验较少的临床医生的诊断表现,但对经验丰富的皮肤科医生影响甚微,表明其效用因技能水平而异。
- 人类对皮肤疾病分类的 top-5 错误率较高(与 ImageNet 的 5.1–12% 错误率相比可推断),表明在区分复杂皮肤科疾病方面存在显著困难。
- 训练数据集中存在的真实标签错误以及真实环境中低质量的图像采集会加剧误差,降低人类与机器诊断的可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。