Skip to main content
QUICK REVIEW

[论文解读] DRDrV3: Complete Lesion Detection in Fundus Images Using Mask R-CNN, Transfer Learning, and LSTM

Farzan Shenavarmasouleh, Farid Ghareh Mohammadi|arXiv (Cornell University)|Aug 18, 2021
Retinal Imaging and Analysis参考文献 20被引用 9
一句话总结

本文提出 DRDrV3,一种统一的深度学习框架,结合 Mask R-CNN、迁移学习和 LSTM,用于在眼底图像中完整检测糖尿病视网膜病变病灶。该框架可同时检测病灶掩码、边界框、病灶类型(渗出物、微动脉瘤)以及整体疾病严重程度,准确率达到 93.47%,在严重程度分类方面优于先前方法,并在 IOU=35 时达到 mAP 0.4562。

ABSTRACT

Medical Imaging is one of the growing fields in the world of computer vision. In this study, we aim to address the Diabetic Retinopathy (DR) problem as one of the open challenges in medical imaging. In this research, we propose a new lesion detection architecture, comprising of two sub-modules, which is an optimal solution to detect and find not only the type of lesions caused by DR, their corresponding bounding boxes, and their masks; but also the severity level of the overall case. Aside from traditional accuracy, we also use two popular evaluation criteria to evaluate the outputs of our models, which are intersection over union (IOU) and mean average precision (mAP). We hypothesize that this new solution enables specialists to detect lesions with high confidence and estimate the severity of the damage with high accuracy.

研究动机与目标

  • 开发单一模型,用于在眼底图像中检测病灶掩码、边界框、病灶类型及整体疾病严重程度。
  • 通过整合 LSTM 和迁移学习,改进先前的 DRDr 和 DRDrII 模型,以增强特征学习和分类能力。
  • 通过鲁棒的特征提取和迁移学习,应对眼底图像在光照、缩放和分辨率方面存在异质性的问题。
  • 使用 IOU、mAP 和准确率评估性能,确保临床相关性和可重复性。
  • 实现糖尿病视网膜病变的早期、自动化检测,以减轻诊断负担并改善患者预后。

提出的方法

  • 该框架采用两阶段方法:第一阶段在 e-ophtha 和 Kaggle 数据集上使用迁移学习的 Mask R-CNN 检测病灶掩码和边界框。
  • 通过使用 ImageNet 预训练权重应用迁移学习,将主干网络(ResNet)适配至眼底图像特征,从而在低资源环境下提升特征提取能力。
  • 第二阶段采用基于 LSTM 的分类器,处理检测到的病灶特征,以预测整体疾病严重程度,分为三类:健康(0)、中度(1)和重度(2)。
  • 该模型通过 LSTM 整合病灶级预测(类型、位置、掩码)与全局严重程度估计,实现端到端的实例和严重程度分割。
  • 评估使用 IOU 阈值为 35、50 和 75 时的 mAP,以及掩码与边界框重叠的 IOU,同时使用准确率评估严重程度分类。
  • 系统在两个数据集上进行训练和验证:e-ophtha(人工标注掩码)和大规模公开的 Kaggle 数据集(35,000 张图像,附带严重程度标签)。

实验结果

研究问题

  • RQ1统一的深度学习模型能否同时在眼底图像中检测病灶掩码、边界框、病灶类型及整体疾病严重程度?
  • RQ2与先前模型相比,将 LSTM 与 Mask R-CNN 和迁移学习结合,如何提升严重程度分类的准确率?
  • RQ3迁移学习在多大程度上缓解了眼底成像中图像异质性导致的性能下降?
  • RQ4在第二阶段中,将病灶掩码和边界框作为输入特征,对严重程度预测有何影响?
  • RQ5mAP、IOU 和准确率等指标在多大程度上与自动化 DR 筛查的临床诊断实用性相关?

主要发现

  • 在 IOU 阈值为 35 时,模型测试 mAP 达到 0.4562,表明对病灶边界框和掩码的检测性能优异。
  • 当使用病灶类别、边界框和掩码作为输入特征时,第二阶段严重程度分类准确率达到 93.47%,优于其他配置。
  • 最佳性能测试选项的混淆矩阵显示,类别 0(健康)真阳性为 2880 例,类别 1(中度)为 771 例,类别 2(重度)为 87 例,表明具有高特异性和敏感性。
  • 在 IOU=50 时,模型的 mAP 为 0.4370;在 IOU=75 时,mAP 为 0.2071,表明在更严格的重叠阈值下仍具鲁棒性。
  • 与先前的 DRDrII 模型相比,LSTM 与 Mask R-CNN 及迁移学习的结合显著提升了严重程度分类的准确率。
  • 使用大规模 Kaggle 数据集(35,000 张图像)有助于防止过拟合,并确保在多样化眼底图像条件下结果的可重复性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。