[论文解读] Evaluating Deep Neural Networks Trained on Clinical Images in Dermatology with the Fitzpatrick 17k Dataset
本文介绍了 Fitzpatrick 17k 数据集,该数据集包含 16,577 幅临床皮肤科图像,并附有 Fitzpatrick 皮肤类型标签,用于评估深度神经网络在不同肤色下的表现。在主要来自较浅肤色类型的图像上进行训练的模型,在较深肤色类型上的准确率显著降低,揭示了由于数据集偏差导致的人工智能皮肤科诊断中存在关键性差异。
How does the accuracy of deep neural network models trained to classify clinical images of skin conditions vary across skin color? While recent studies demonstrate computer vision models can serve as a useful decision support tool in healthcare and provide dermatologist-level classification on a number of specific tasks, darker skin is underrepresented in the data. Most publicly available data sets do not include Fitzpatrick skin type labels. We annotate 16,577 clinical images sourced from two dermatology atlases with Fitzpatrick skin type labels and open-source these annotations. Based on these labels, we find that there are significantly more images of light skin types than dark skin types in this dataset. We train a deep neural network model to classify 114 skin conditions and find that the model is most accurate on skin types similar to those it was trained on. In addition, we evaluate how an algorithmic approach to identifying skin tones, individual typology angle, compares with Fitzpatrick skin type labels annotated by a team of human labelers.
研究动机与目标
- 为解决公开皮肤科图像数据集中缺乏皮肤类型标注的问题,特别是对代表性不足的深色皮肤类型。
- 利用新标注的数据集,研究模型在分类皮肤疾病时的准确率如何随 Fitzpatrick 皮肤类型而变化。
- 比较人工标注的 Fitzpatrick 皮肤类型标签与基于个体分型角度(ITA)的自动化肤色估计之间的表现。
- 揭示并量化在训练数据不平衡的皮肤科图像数据上训练的深度学习模型的准确率差异。
- 通过在不同肤色子组中实现对偏差的实证评估,促进人工智能驱动皮肤科领域中的公平性与透明度。
提出的方法
- 通过一组人类标注员,为来自两个开放获取图谱(DermaAmin 和 Atlas Dermatologico)的 16,577 幅临床皮肤科图像标注了 Fitzpatrick 皮肤类型标签。
- 基于在 ImageNet 上预训练的微调 VGG-16 架构,使用仅图像数据训练了一个深度神经网络,以分类 114 种皮肤疾病。
- 通过评估模型在不同 Fitzpatrick 皮肤类型上的表现,测量其在训练数据分布下的准确率差异。
- 使用公式 $ ITA = \tan^{-1} \left( \frac{B - Y}{R - Y} \right) \times \frac{180}{\pi} $ 从图像的 RGB 值计算个体分型角度(ITA),其中 R、G、B 为 RGB 值,Y 为亮度。
- 使用两种阈值化方案将 ITA 分数映射到 Fitzpatrick 皮肤类型:Kinyanjui 等人(2017)的方法和通过经验推导的版本(公式 15),后者旨在最小化分类误差。
- 通过两名获得认证的皮肤科医生对随机抽取的 3% 样本(504 幅图像)进行数据质量检查,确认误差率为 3.4%,与标准基准一致。
实验结果
研究问题
- RQ1深度神经网络在皮肤科图像分类中的准确率如何随不同 Fitzpatrick 皮肤类型而变化?
- RQ2由于训练数据集中存在数据不平衡,模型性能在多大程度上偏向于较浅肤色类型?
- RQ3个体分型角度(ITA)算法在不同肤色范围内与人工标注的 Fitzpatrick 皮肤类型标签的一致性如何?
- RQ4与专家标注的标签相比,基于 ITA 的肤色估计在临床皮肤科图像中的实证误差率是多少?
- RQ5Fitzpatrick 17k 数据集能否作为评估人工智能模型在皮肤科领域公平性与偏差的基准?
主要发现
- Fitzpatrick 17k 数据集包含 16,577 幅临床图像,其中 Fitzpatrick 皮肤类型 1 和 2 的图像数量是类型 5 和 6 的 3.6 倍,显示出深色皮肤类型存在显著代表性不足。
- 深度神经网络模型在分类皮肤疾病方面表现良好,但在较深的 Fitzpatrick 皮肤类型上表现明显下降,与类型 1 和 2 相比,类型 5 和 6 的准确率显著降低。
- 使用 Kinyanjui 阈值时,人工标注的 Fitzpatrick 皮肤类型标签与 ITA 分数的符合率在 45.87% 至 78.21% 之间;使用经验阈值时,符合率在 60.34% 至 82.26% 之间,表明自动化肤色估计存在显著误差。
- 基于 ITA 的最准确分类在约三分之一的数据集中与实际 Fitzpatrick 等级相差超过一个等级,凸显了依赖 ITA 进行肤色标注的局限性。
- 模型的准确率在与训练数据中相似的皮肤类型上最高,证实了数据分布直接影响模型偏差和性能异质性。
- 本研究证实,皮肤科图像数据集中存在的数据偏差会导致人工智能模型性能的可测量差异,尤其对深色皮肤患者构成不利影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。