[论文解读] Disparities in Dermatology AI: Assessments Using Diverse Clinical Images
本研究提出了多样化的皮肤病图像(DDI)数据集——该数据集包含经过组织病理学确诊、涵盖多种皮肤色调及罕见疾病的图像,用于评估皮肤病人工智能模型。研究发现,最先进模型在DDI上的ROC-AUC下降了29–40%,且在深色皮肤(Fitzpatrick V–VI型)和罕见疾病上存在显著性能差异。此外,研究显示,若缺乏多样化训练数据,即使采用鲁棒训练方法也无法缓解性能偏差,揭示了当前皮肤病人工智能工具中存在关键性偏差。
More than 3 billion people lack access to care for skin disease. AI diagnostic tools may aid in early skin cancer detection; however most models have not been assessed on images of diverse skin tones or uncommon diseases. To address this, we curated the Diverse Dermatology Images (DDI) dataset - the first publicly available, pathologically confirmed images featuring diverse skin tones. We show that state-of-the-art dermatology AI models perform substantially worse on DDI, with ROC-AUC dropping 29-40 percent compared to the models' original results. We find that dark skin tones and uncommon diseases, which are well represented in the DDI dataset, lead to performance drop-offs. Additionally, we show that state-of-the-art robust training methods cannot correct for these biases without diverse training data. Our findings identify important weaknesses and biases in dermatology AI that need to be addressed to ensure reliable application to diverse patients and across all disease.
研究动机与目标
- 为解决当前人工智能训练与测试数据集中缺乏多样化、经组织病理学确诊的皮肤病图像的问题。
- 评估最先进皮肤病人工智能模型在涵盖多样化皮肤色调和罕见疾病的图像上的表现。
- 探究鲁棒训练方法是否能缓解不同皮肤类型与疾病罕见程度之间的性能差异。
- 证明模型偏差源于训练数据分布,而不仅仅是算法设计。
- 建立一个公开可用的基准数据集(DDI),以推动公平、可泛化的皮肤病人工智能发展。
提出的方法
- 从斯坦福病理报告(2010–2020年)中整理出多样化的皮肤病图像(DDI)数据集,包含经组织病理学确诊的诊断结果及Fitzpatrick皮肤类型(FST)I–VI的标注。
- 筛选图像以确保浅色皮肤(FST I–II型)与深色皮肤(FST V–VI型)的代表性均衡,并纳入罕见疾病(发病率<1/10,000)。
- 使用标准指标(如ROC-AUC和敏感性)在DDI数据集上评估三种预训练皮肤病人工智能模型——ModelDerm、DeepDerm和HAM10000的性能。
- 对DeepDerm应用鲁棒训练方法(GroupDRO、CORAL、CDANN),并使用皮肤类型分组的源数据集代理进行训练,以测试偏差缓解效果。
- 按皮肤类型和疾病罕见程度进行分层分析,以分离性能下降的原因。
- 使用原始模型在训练数据中确定的阈值,以避免过拟合并模拟真实世界部署场景。
实验结果
研究问题
- RQ1最先进皮肤病人工智能模型在包含代表性不足皮肤色调和罕见疾病的多样化、经组织病理学确诊数据集上的表现如何?
- RQ2皮肤类型(Fitzpatrick I–II型 vs. V–VI型)和疾病罕见程度在多大程度上导致皮肤病人工智能模型的性能差异?
- RQ3在缺乏多样化训练数据的前提下,鲁棒训练方法(如GroupDRO、CORAL和CDANN)能否纠正性能差异?
- RQ4从常见疾病到罕见疾病的分布偏移如何影响模型的泛化能力?
- RQ5模型在原始测试集上的性能指标在多大程度上能推广至真实世界中多样化临床数据?
主要发现
- 最先进皮肤病人工智能模型在DDI数据集上的ROC-AUC相比其原始报告结果下降了29–40%。
- ModelDerm在Fitzpatrick I–II型皮肤上的敏感性为0.41,在Fitzpatrick V–VI型皮肤上仅为0.12(p = 0.0025),表明深色皮肤的性能存在显著差异。
- DeepDerm在Fitz I–II型皮肤上的敏感性为0.69,在Fitz V–VI型皮肤上下降至0.23,且p值为5.65 × 10⁻⁶,具有统计学显著性。
- 尽管HAM10000在其自身测试集上的敏感性为0.68,但在整个DDI数据集上的敏感性仅为0.04,表明其阈值泛化能力极差。
- 即使应用了鲁棒训练方法(GroupDRO、CORAL、CDANN),在不同皮肤类型间的公平性也未见改善,表明缺乏多样化训练数据是问题的根本原因。
- 在DDI数据集中排除罕见疾病后的常见疾病上,性能仍低于原始测试集表现,且DeepDerm在Fitz I–II型与V–VI型皮肤间仍存在显著敏感性差异(0.71 vs. 0.31,p = 0.007)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。