Skip to main content
QUICK REVIEW

[论文解读] Addressing Artificial Intelligence Bias in Retinal Disease Diagnostics

Philippe Burlina, Neil Joshi|arXiv (Cornell University)|Apr 28, 2020
Retinal Imaging and Analysis参考文献 22被引用 11
一句话总结

本研究提出使用生成对抗网络(GANs)生成合成视网膜图像,以缓解因数据不平衡和领域偏移导致的人工智能偏见问题,特别针对肤色较深且患有需转诊的糖尿病性视网膜病变的亚群体。该方法将肤色较浅与较深个体之间的性能差异从12.5%降低至仅0.5%,在两组中实现近乎相同的准确率(72.0% vs. 71.5%)。

ABSTRACT

This study evaluated generative methods to potentially mitigate AI bias when diagnosing diabetic retinopathy (DR) resulting from training data imbalance, or domain generalization which occurs when deep learning systems (DLS) face concepts at test/inference time they were not initially trained on. The public domain Kaggle-EyePACS dataset (88,692 fundi and 44,346 individuals, originally diverse for ethnicity) was modified by adding clinician-annotated labels and constructing an artificial scenario of data imbalance and domain generalization by disallowing training (but not testing) exemplars for images of retinas with DR warranting referral (DR-referable) and from darker-skin individuals, who presumably have greater concentration of melanin within uveal melanocytes, on average, contributing to retinal image pigmentation. A traditional/baseline diagnostic DLS was compared against new DLSs that would use training data augmented via generative models for debiasing. Accuracy (95% confidence intervals [CI]) of the baseline diagnostics DLS for fundus images of lighter-skin individuals was 73.0% (66.9%, 79.2%) vs. darker-skin of 60.5% (53.5%, 67.3%), demonstrating bias/disparity (delta=12.5%) (Welch t-test t=2.670, P=.008) in AI performance across protected subpopulations. Using novel generative methods for addressing missing subpopulation training data (DR-referable darker-skin) achieved instead accuracy, for lighter-skin, of 72.0% (65.8%, 78.2%), and for darker-skin, of 71.5% (65.2%,77.8%), demonstrating closer parity (delta=0.5%) in accuracy across subpopulations (Welch t-test t=0.111, P=.912). Findings illustrate how data imbalance and domain generalization can lead to disparity of accuracy across subpopulations, and show that novel generative methods of synthetic fundus images may play a role for debiasing AI.

研究动机与目标

  • 探究数据不平衡与领域泛化在视网膜疾病诊断中的人工智能偏见形成机制。
  • 评估生成式数据增强是否能缓解如肤色较深人群等受保护亚群体之间的性能差异。
  • 证明合成数据生成可弥合肤色较浅与较深个体在糖尿病性视网膜病变检测中的准确率差距。
  • 评估当在训练数据中代表性不足的亚群体上测试时,领域偏移对人工智能模型性能的影响。
  • 为医学影像人工智能提供一种适用于代表性不足群体的去偏框架,基于合成数据。

提出的方法

  • 研究人员通过从公开的Kaggle-EyePACS数据集中移除肤色较深个体的糖尿病性视网膜病变需转诊病例的训练样本,以模拟数据不平衡与领域偏移。
  • 在不平衡数据集上训练基线深度学习系统(DLS),以建立不同肤色群体间的性能基准。
  • 训练一种新型生成模型(基于GAN)以合成肤色较深个体中糖尿病性视网膜病变需转诊病例的真实感眼底图像。
  • 将合成图像用于增强训练数据,对第二个DLS进行训练,并评估其公平性与准确率。
  • 通过不同肤色群体子群体的准确率及其95%置信区间,对比基线模型与增强后模型的性能。
  • 使用Welch's t检验评估性能差异的统计显著性。

实验结果

研究问题

  • RQ1肤色类型之间的数据不平衡在多大程度上导致人工智能在糖尿病性视网膜病变诊断中的性能差异?
  • RQ2生成模型能否有效合成代表性不足亚群体的真实感视网膜图像,以减少人工智能偏见?
  • RQ3合成数据增强是否能提升肤色较浅与较深个体在诊断准确率方面的公平性?
  • RQ4当在训练数据中代表性不足的亚群体上测试时,领域泛化如何影响人工智能模型的性能?
  • RQ5生成方法能否弥合视网膜疾病诊断中不同亚群体之间的准确率差距?

主要发现

  • 基线DLS在肤色较浅个体(73.0%)与肤色较深个体(60.5%)之间表现出12.5%的准确率差距,且具有统计学显著性(P = .008)。
  • 在对肤色较深个体的糖尿病性视网膜病变需转诊病例应用生成式数据增强后,准确率差距降低至仅0.5%(肤色较浅者为72.0%,肤色较深者为71.5%)。
  • Welch t检验确认增强后两组间性能无显著差异(P = .912),表明性能接近均等。
  • 该生成方法在两组中均保持了高诊断准确率,且95%置信区间在各子群体间重叠。
  • 结果表明,合成数据生成可有效应对视网膜诊断中由数据不平衡与领域偏移引发的偏见问题。
  • 本研究为生成模型在医学人工智能应用中作为可行去偏策略提供了实证依据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。