Skip to main content
QUICK REVIEW

[论文解读] Docs are ROCs: A simple off-the-shelf approach for estimating average human performance in diagnostic studies

Luke Oakden‐Rayner, Lyle J. Palmer|arXiv (Cornell University)|Sep 23, 2020
Artificial Intelligence in Healthcare and Education参考文献 11被引用 5
一句话总结

本文提出使用受试者工作特征(SROC)曲线分析——一种诊断试验荟萃分析中的标准方法——作为一种稳健的现成方法,用于估计医学人工智能诊断研究中的人类平均表现。通过建模多个病例中个体阅片者的表现,SROC分析纠正了在汇总指标中普遍存在的对人类敏感性和特异性的系统性低估,为多阅片者多病例研究中的人工智能模型评估提供了更准确的基准。

ABSTRACT

Estimating average human performance has been performed inconsistently in research in diagnostic medicine. This has been particularly apparent in the field of medical artificial intelligence, where humans are often compared against AI models in multi-reader multi-case studies, and commonly reported metrics such as the pooled or average human sensitivity and specificity will systematically underestimate the performance of human experts. We present the use of summary receiver operating characteristic curve analysis, a technique commonly used in the meta-analysis of diagnostic test accuracy studies, as a sensible and methodologically robust alternative. We describe the motivation for using these methods and present results where we apply these meta-analytic techniques to a handful of prominent medical AI studies.

研究动机与目标

  • 解决诊断AI研究中平均人类表现估计不一致且常不准确的问题。
  • 识别在多阅片者多病例研究中,汇总敏感性和特异性指标的局限性。
  • 提出一种基于SROC曲线分析的方法学上可靠的替代方案,以更准确地估计人类表现。
  • 在知名医学AI研究中展示SROC方法的实际应用。
  • 为研究人员提供一种简单、即插即用的解决方案,以改进诊断AI研究中的基准测试。

提出的方法

  • 采用受试者工作特征(SROC)曲线分析,这是诊断荟萃分析中的标准技术,用于建模多个病例中的阅片者表现。
  • 使用随机效应模型以考虑阅片者表现和病例难度的变异性。
  • 拟合分层模型,汇总各研究中个体阅片者的AUC、敏感性和特异性值。
  • 将SROC方法应用于真实世界的医学AI研究,以估计平均人类表现。
  • 利用成熟的统计软件和框架进行SROC分析,以确保可重复性和可及性。
  • 通过将SROC估计值与基准研究中的传统汇总指标进行比较,验证该方法的有效性。

实验结果

研究问题

  • RQ1传统汇总敏感性和特异性指标在诊断研究中如何系统性地低估平均人类表现?
  • RQ2SROC曲线分析在多大程度上能比汇总指标更准确地估计平均诊断表现?
  • RQ3SROC分析能否作为多阅片者多病例诊断研究中一种直接、即插即用的方法?
  • RQ4SROC推导出的人类表现估计值与知名医学AI研究中的结果相比如何?
  • RQ5与简单平均相比,SROC分析在诊断表现评估中具有哪些方法学优势?

主要发现

  • SROC曲线分析始终提供比汇总敏感性和特异性指标更高且更可靠的平均人类表现估计值。
  • 该方法纠正了汇总指标中存在的系统性偏差,后者往往低估了真实的人类诊断准确性。
  • 将SROC应用于现有医学AI研究发现,人类表现通常高于以往使用传统指标报告的结果。
  • 该方法稳健、方法学上合理,可使用标准统计工具实现,无需定制开发。
  • 基于SROC的估计值在各研究间具有一致性,更能反映专家阅片者的实际表现。
  • 本研究证明,SROC是诊断医学中AI模型基准测试的一种可行、可访问且准确的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。