Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Bayesian Deep Learning on Diabetic Retinopathy Detection Tasks

Neil Band, Tim G. J. Rudner|arXiv (Cornell University)|Nov 23, 2022
Anomaly Detection Techniques and Applications参考文献 34被引用 15
一句话总结

本文提出了Retina Benchmark,这是一个真实、开源的糖尿病视网膜病变检测任务套件,旨在评估贝叶斯深度学习模型在安全关键型医疗场景中的可靠性。该基准使用任务特定指标,在高分辨率眼底图像上对最先进贝叶斯方法进行评估,结果表明:经过不确定性校准的深度集成(deep ensembles)和蒙特卡洛 dropout(Monte Carlo dropout)在性能和不确定性估计方面表现最佳,尤其在分布偏移情况下表现更优。

ABSTRACT

Bayesian deep learning seeks to equip deep neural networks with the ability to precisely quantify their predictive uncertainty, and has promised to make deep learning more reliable for safety-critical real-world applications. Yet, existing Bayesian deep learning methods fall short of this promise; new methods continue to be evaluated on unrealistic test beds that do not reflect the complexities of downstream real-world tasks that would benefit most from reliable uncertainty quantification. We propose the RETINA Benchmark, a set of real-world tasks that accurately reflect such complexities and are designed to assess the reliability of predictive models in safety-critical scenarios. Specifically, we curate two publicly available datasets of high-resolution human retina images exhibiting varying degrees of diabetic retinopathy, a medical condition that can lead to blindness, and use them to design a suite of automated diagnosis tasks that require reliable predictive uncertainty quantification. We use these tasks to benchmark well-established and state-of-the-art Bayesian deep learning methods on task-specific evaluation metrics. We provide an easy-to-use codebase for fast and easy benchmarking following reproducibility and software design principles. We provide implementations of all methods included in the benchmark as well as results computed over 100 TPU days, 20 GPU days, 400 hyperparameter configurations, and evaluation on at least 6 random seeds each.

研究动机与目标

  • 为解决在安全关键型应用中缺乏标准化、真实场景的贝叶斯深度学习评估基准的问题。
  • 设计反映真实世界医学诊断复杂性的下游任务,特别是在从高分辨率眼底图像中检测糖尿病视网膜病变方面。
  • 使用评估预测性能和不确定性可靠性的任务特定指标,对现有及最先进贝叶斯深度学习方法进行评估。
  • 提供一个可复现、模块化且可扩展的代码库,包含在400种超参数配置下训练超过100 TPU天和20 GPU天的预训练模型。
  • 使实践者能够仅凭最少的领域知识,使用真实世界数据和评估协议,对新方法进行基准测试。

提出的方法

  • 作者整理了两个公开数据集——EyePACS 和 APTOS——其中包含不同程度糖尿病视网膜病变的高分辨率眼底图像。
  • 设计了两个安全关键型诊断任务:一个用于标准检测,另一个通过图像模糊模拟分布偏移,以测试鲁棒性。
  • 使用准确率、AUROC 和不确定性校准等指标,评估蒙特卡洛 dropout、深度集成和 MAP 推断等贝叶斯深度学习方法。
  • 采用基于阈值的自动化诊断流程,其中不确定性低于阈值 γ 的预测被接受,否则转交人类专家处理。
  • 该基准在400种配置下进行了广泛的超参数调优,并在6个随机种子上评估结果,结果报告基于100 TPU天和20 GPU天的计算资源。
  • 代码库已开源,注重可复现性,便于轻松对新方法进行基准测试。

实验结果

研究问题

  • RQ1在真实世界的糖尿病视网膜病变检测任务中,不同贝叶斯深度学习方法在预测准确率和不确定性校准方面表现如何?
  • RQ2这些方法在分布偏移(如通过图像模糊模拟分布外数据)下的泛化能力如何?
  • RQ3哪种贝叶斯方法能提供最可靠的不确定性估计,且与安全关键型医疗场景中预测正确性高度相关?
  • RQ4标准化、开源的基准是否能提升可复现性,并促进医学人工智能中贝叶斯深度学习方法的公平比较?
  • RQ5当与专家审查阈值结合时,不确定性量化如何影响自动化诊断流程的可靠性?

主要发现

  • 在 APTOS 2019 偏移数据集上,经过模糊增强的深度集成方法(如 -blur30)取得了最高的准确率(94.2% ± 0.2)和 AUROC(98.4% ± 0.0),优于其他方法。
  • 采用集成平均的蒙特卡洛 dropout 方法表现强劲,在同一测试集上达到 94.1% ± 0.1 的准确率和 98.3% ± 0.0 的 AUROC。
  • 在 EyePACS 数据集上,采用 -blur20 和 -blur30 的深度集成方法分别实现了 97.9% ± 0.0 和 98.4% ± 0.0 的 AUROC,表明其在不确定性下仍具有高度可靠性。
  • 不确定性校准最优的方法是深度集成 -blur30,在 APTOS 偏移数据集上达到 98.4% ± 0.0 的 AUROC,表明不确定性与预测正确性之间存在强相关性。
  • 经过恰当不确定性校准的贝叶斯方法显著降低了分布外设置下的假阳性率,其不确定性估计能有效识别模糊案例并提交专家审查。
  • Retina Benchmark 表明,具备不确定性感知能力的模型可减少对低不确定性案例的人工审查依赖,同时保持高诊断可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。