Skip to main content
QUICK REVIEW

[论文解读] DRG-Net: Interactive Joint Learning of Multi-lesion Segmentation and Classification for Diabetic Retinopathy Grading

Hasan Tusfiqur, Duy M. H. Nguyen|arXiv (Cornell University)|Dec 30, 2022
Retinal Imaging and Analysis被引用 6
一句话总结

DRG-Net 提出了一种用于糖尿病视网膜病变分级的交互式联合学习框架,通过领域不变特征学习和注意力机制,同时执行多病灶分割与疾病分类。通过整合用户反馈和对抗性训练,该方法提升了模型的鲁棒性和可解释性,在 IDRID 和 FGADR 数据集上实现了弱监督反馈下的最先进性能。

ABSTRACT

Diabetic Retinopathy (DR) is a leading cause of vision loss in the world, and early DR detection is necessary to prevent vision loss and support an appropriate treatment. In this work, we leverage interactive machine learning and introduce a joint learning framework, termed DRG-Net, to effectively learn both disease grading and multi-lesion segmentation. Our DRG-Net consists of two modules: (i) DRG-AI-System to classify DR Grading, localize lesion areas, and provide visual explanations; (ii) DRG-Expert-Interaction to receive feedback from user-expert and improve the DRG-AI-System. To deal with sparse data, we utilize transfer learning mechanisms to extract invariant feature representations by using Wasserstein distance and adversarial learning-based entropy minimization. Besides, we propose a novel attention strategy at both low- and high-level features to automatically select the most significant lesion information and provide explainable properties. In terms of human interaction, we further develop DRG-Net as a tool that enables expert users to correct the system's predictions, which may then be used to update the system as a whole. Moreover, thanks to the attention mechanism and loss functions constraint between lesion features and classification features, our approach can be robust given a certain level of noise in the feedback of users. We have benchmarked DRG-Net on the two largest DR datasets, i.e., IDRID and FGADR, and compared it to various state-of-the-art deep learning networks. In addition to outperforming other SOTA approaches, DRG-Net is effectively updated using user feedback, even in a weakly-supervised manner.

研究动机与目标

  • 为解决黑箱模型在糖尿病视网膜病变(DR)诊断中的局限性,实现临床医生与人工智能之间的可解释性、交互式学习。
  • 通过共享的、注意力驱动的特征,联合优化多病灶分割与 DR 分级,以提升模型的泛化能力和鲁棒性。
  • 通过允许用户通过弱监督方式(如边界框)纠正预测结果,而非依赖像素级精确标注,降低对精确标注的依赖。
  • 通过注意力机制和病灶与分类特征之间的损失约束,增强模型对噪声或不精确用户反馈的鲁棒性。
  • 开发一种通过专家交互持续进化的协作式人工智能系统,以最小的标注工作量实现性能的持续提升。

提出的方法

  • DRG-Net 采用双模块架构:DRG-AI-System 负责分类、病灶定位与解释,DRG-Expert-Interaction 负责用户反馈的集成。
  • 领域不变病灶特征生成器利用迁移学习和基于 Wasserstein 距离的对抗性学习,最小化领域差异,提升跨数据集的特征泛化能力。
  • 在低层和高层特征上应用一种新型多尺度注意力机制,动态强调显著的病灶区域,提升可解释性。
  • 通过基于对抗性学习的熵最小化方法,增强模型对标签噪声的鲁棒性,并在数据稀缺条件下提升泛化能力。
  • 通过弱监督微调方式整合用户反馈,使用边界框修正来更新模型,而无需完整实例分割。
  • 损失函数被设计为强制对齐病灶特征与分类预测,确保分割质量能直接提升分级性能。

实验结果

研究问题

  • RQ1与独立训练分割和分级任务相比,联合学习病灶分割与 DR 分级是否能提升模型性能?
  • RQ2如何有效利用用户反馈(如粗糙标注,例如边界框)以弱监督方式提升模型准确性?
  • RQ3一种突出病灶相关特征的注意力机制在多大程度上能增强模型的可解释性并提升对噪声反馈的鲁棒性?
  • RQ4领域不变特征学习是否能缓解因领域差异和标注数据有限导致的性能下降?
  • RQ5在真实临床诊断环境中,临床证据(如激活图、病灶掩码)的整合在多大程度上能支持专家信任与决策?

主要发现

  • 在 IDRID 和 FGADR 数据集上,DRG-Net 在分割和分类性能方面均优于最先进方法,证明了其在数据稀缺条件下的优越泛化能力。
  • 模型对用户反馈噪声表现出高度鲁棒性,即使修正不精确或不完整,仍能保持性能稳定,归因于基于注意力的特征选择和损失约束。
  • 病灶注意力的集成显著提升了类激活图与真实病灶区域之间的重叠程度,如图 17 的可视化对比所示,证实了可解释性的增强。
  • 通过边界框修正的用户反馈成功微调了模型,实现了分割和分级任务的可测量性能提升,且无需像素级标注。
  • 该框架通过迭代式专家交互实现了模型的持续改进,验证了其作为临床工作流中协作式 AI 系统的可行性。
  • 消融实验证实,对抗性学习、领域自适应与注意力机制的结合是实现最优性能与鲁棒性的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。