Skip to main content
QUICK REVIEW

[论文解读] Multi-Label Generalized Zero Shot Learning for the Classification of Disease in Chest Radiographs

Nasir Hayat, Hazem Lashen|arXiv (Cornell University)|Jul 14, 2021
COVID-19 diagnosis using AI参考文献 28被引用 7
一句话总结

该论文提出CX-ML-GZSL,一种用于胸部X光疾病分类的端到端可训练多标签广义零样本学习框架,通过将视觉模态与语义模态联合嵌入共享潜在空间。该方法在NIH胸部X光数据集上优于强基线模型,实现了0.718的调和平均F1得分,并在无需未见类别标注数据的情况下,展现出对未见疾病的稳健泛化能力。

ABSTRACT

Despite the success of deep neural networks in chest X-ray (CXR) diagnosis, supervised learning only allows the prediction of disease classes that were seen during training. At inference, these networks cannot predict an unseen disease class. Incorporating a new class requires the collection of labeled data, which is not a trivial task, especially for less frequently-occurring diseases. As a result, it becomes inconceivable to build a model that can diagnose all possible disease classes. Here, we propose a multi-label generalized zero shot learning (CXR-ML-GZSL) network that can simultaneously predict multiple seen and unseen diseases in CXR images. Given an input image, CXR-ML-GZSL learns a visual representation guided by the input's corresponding semantics extracted from a rich medical text corpus. Towards this ambitious goal, we propose to map both visual and semantic modalities to a latent feature space using a novel learning objective. The objective ensures that (i) the most relevant labels for the query image are ranked higher than irrelevant labels, (ii) the network learns a visual representation that is aligned with its semantics in the latent feature space, and (iii) the mapped semantics preserve their original inter-class representation. The network is end-to-end trainable and requires no independent pre-training for the offline feature extractor. Experiments on the NIH Chest X-ray dataset show that our network outperforms two strong baselines in terms of recall, precision, f1 score, and area under the receiver operating characteristic curve. Our code is publicly available at: https://github.com/nyuad-cai/CXR-ML-GZSL.git

研究动机与目标

  • 为解决监督深度学习模型因缺乏标注数据而无法预测未见疾病类别的问题,特别是针对罕见或新发疾病。
  • 实现在胸部X光影像中的多标签分类,其中可能同时存在多种疾病,包括训练期间未见的疾病。
  • 开发一种零样本学习框架,将视觉特征与语义嵌入映射到共享潜在空间,无需预训练视觉编码器。
  • 设计一种新型损失函数,确保语义对齐、视觉-语义对应关系,并在潜在空间中保持语义关系结构。
  • 通过严格的零样本协议(训练期间不使用未见类别的辅助数据)评估模型在未见疾病类别上的泛化能力。

提出的方法

  • 模型使用视觉特征编码器和两个投影头,将视觉特征与语义嵌入映射到共享潜在空间,实现联合优化。
  • 提出一种新型学习目标,结合三个组成部分:排序损失以优先关注相关标签,对齐损失以将视觉特征集中在类别语义周围,一致性损失以在潜在空间中保持语义结构。
  • 网络采用端到端训练,无需对视觉编码器进行离线预训练,从而实现视觉表征与语义对齐的联合优化。
  • 语义嵌入源自丰富的医学文本语料库,捕捉上下文相关的疾病属性,以指导零样本泛化。
  • 模型通过在潜在空间中使用余弦相似度计算图像特征与类别嵌入之间的相似度得分,实现对多个标签的同步预测。
  • 训练策略包括对初始学习率和温度参数γ的超参数调优,并通过消融研究验证了端到端训练的优势。

实验结果

研究问题

  • RQ1多标签广义零样本学习框架是否能在无需未见类别标注数据的情况下,有效分类胸部X光图像中的已见和未见疾病?
  • RQ2与使用预训练视觉编码器相比,视觉编码器与语义投影头的端到端训练在零样本泛化性能上表现如何?
  • RQ3所提出的损失函数在多大程度上改善了视觉-语义对齐并保持了潜在空间中的语义结构?
  • RQ4在严格的零样本评估协议下,模型是否能在已见和未见类别上均保持高性能?
  • RQ5模型在不同已见与未见类别划分下的性能表现如何?其对类别分布偏移的鲁棒性如何?

主要发现

  • 所提出的CX-ML-GZSL模型在NIH胸部X光数据集上实现了0.718的调和平均F1得分,优于两个强基线模型的所有指标。
  • 视觉编码器的端到端训练性能更优(调和平均F1:0.718),优于在ImageNet上预训练(0.660)或在NIH数据集上预训练(0.681)的设置。
  • 模型在已见类别上的召回率为0.783,在未见类别上的精确率为0.663,表明其对罕见或新发疾病具有强大的泛化能力。
  • 消融研究证实,包含损失函数全部三个组件(排序、对齐、一致性)的模型表现最佳,完整模型优于缺少一个或多个组件的变体。
  • 模型在已见类别(AUROC:0.783)和未见类别(AUROC:0.663)上均保持高AUROC值,且在同时预测多个标签时表现稳健,即使面对此前未见的疾病类别亦然。
  • 结果表明,模型能有效利用医学文本中提取的上下文语义表征,实现对未见疾病的泛化,支持其在罕见或新发疾病检测中临床部署的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。