Skip to main content
QUICK REVIEW

[论文解读] CheXphotogenic: Generalization of Deep Learning Models for Chest X-ray Interpretation to Photos of Chest X-rays

Pranav Rajpurkar, Anirudh Joshi|arXiv (Cornell University)|Nov 12, 2020
COVID-19 diagnosis using AI参考文献 13被引用 6
一句话总结

本研究评估了八种深度学习模型在智能手机拍摄的X光片上进行胸部X光片解读时的表现,使用的是CheXphoto数据集。尽管在照片上的马修斯相关系数(MCC)平均下降了0.036,但多个模型的表现仍与经过认证的放射科医生相当,表明其在低资源环境中通过移动影像实现可扩展部署具有潜力。

ABSTRACT

The use of smartphones to take photographs of chest x-rays represents an appealing solution for scaled deployment of deep learning models for chest x-ray interpretation. However, the performance of chest x-ray algorithms on photos of chest x-rays has not been thoroughly investigated. In this study, we measured the diagnostic performance for 8 different chest x-ray models when applied to photos of chest x-rays. All models were developed by different groups and submitted to the CheXpert challenge, and re-applied to smartphone photos of x-rays in the CheXphoto dataset without further tuning. We found that several models had a drop in performance when applied to photos of chest x-rays, but even with this drop, some models still performed comparably to radiologists. Further investigation could be directed towards understanding how different model training procedures may affect model generalization to photos of chest x-rays.

研究动机与目标

  • 评估深度学习模型在应用于智能手机拍摄的X光片时,对胸部X光片解读的泛化性能。
  • 在多种病理情况下,比较模型在照片与原始数字X光片上的表现差异。
  • 评估模型在解读X光片照片时,其表现是否与放射科医生相当。
  • 识别哪些病理或伪影对模型在照片输入下的表现影响最为显著。

提出的方法

  • 在智能手机拍摄的胸部X光片数据集CheXphoto上,评估了八种在CheXpert挑战赛中获奖的模型,所有模型均为使用密集连接卷积网络的集成模型。
  • 通过CodaLab平台重新运行模型在CheXphoto测试集上的推理,以确保评估的一致性,且无需重新训练。
  • 使用马修斯相关系数(MCC)和AUC衡量二分类任务在五种病理(肺不张、心脏扩大、实变、肺水肿和胸腔积液)上的表现。
  • 通过配对MCC差异的95%置信区间,将模型在照片上的表现与在原始数字X光片上的表现以及放射科医生的表现进行比较。
  • 使用CheXpert挑战赛的隐藏测试集,以确保评估的完整性并避免数据泄露。
  • 分析每种病理和每种模型的性能下降情况,以识别模型对眩光、模糊和角度变化等图像伪影的鲁棒性趋势。

实验结果

研究问题

  • RQ1与原始数字图像相比,深度学习模型在应用于智能手机拍摄的X光片时,其在胸部X光片解读中的表现如何?
  • RQ2在应用到照片时,哪些特定病理的性能下降最为显著?
  • RQ3这些模型在照片上的表现在多大程度上与经过认证的放射科医生相当或更优?
  • RQ4照片中的特定图像伪影(如眩光、模糊、旋转)是否对模型表现产生不成比例的影响?
  • RQ5不同的模型架构和训练方法在多大程度上影响模型对照片输入的泛化能力?

主要发现

  • 所有八个模型在应用于胸部X光片照片时,MCC均出现统计学上显著的下降,平均下降0.036(95%置信区间:0.024–0.048)。
  • 性能下降最显著的是胸腔积液(七种模型的表现显著低于放射科医生),其次是心脏扩大(五种模型表现下降)。
  • 尽管存在性能下降,但八种模型中有五种在平均表现上与放射科医生无显著差异,另有三种模型在特定病理(如心脏扩大和肺水肿)上甚至优于放射科医生。
  • 从数字X光片到照片,AUC平均下降0.016(95%置信区间:0.012–0.019)。
  • 模型在照片上的MCC平均为0.560(95%置信区间:0.528–0.587),而原始数字图像上的MCC为0.588(95%置信区间:0.560–0.618)。
  • 放射科医生在照片上的表现为0.568(95%置信区间:0.542–0.597),表明模型在照片上的表现仍与人类解读相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。