Skip to main content
QUICK REVIEW

[论文解读] CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios

Jingyang Lin, Yingda Xia|arXiv (Cornell University)|Apr 23, 2024
Radiomics and Machine Learning in Medical ImagingMedicine被引用 3
一句话总结

CT-GLIP 提出了一种新颖的 3D 医学视觉-语言预训练框架,用于全身影像 CT 扫描和放射科报告,通过器官级别的图像-文本对以及异常词典增强对比学习。该方法在器官和异常识别任务中实现了最先进的零样本和微调性能,在非增强 CT 扫描中进行癌症检测时,AUC 指标相比原始 CLIP 最高提升 7.7%。

ABSTRACT

3D medical vision-language (VL) pretraining has shown potential in radiology by leveraging large-scale multimodal datasets with CT-report pairs. However, existing methods primarily rely on a global VL alignment directly adapted from 2D scenarios. The entire 3D image is transformed into one global embedding, resulting in a loss of sparse but critical semantics essential for accurately aligning with the corresponding diagnosis. To address this limitation, we propose CT-GLIP, a 3D Grounded Language-Image Pretrained model that constructs fine-grained CT-report pairs to enhance extit{grounded} cross-modal contrastive learning, effectively aligning grounded visual features with precise textual descriptions. Leveraging the grounded cross-modal alignment, CT-GLIP improves performance across diverse downstream tasks and can even identify organs and abnormalities in a zero-shot manner using natural language. CT-GLIP is trained on a multimodal CT dataset comprising 44,011 organ-level CT-report pairs from 17,702 patients, covering 104 organs. Evaluation is conducted on four downstream tasks: zero-shot organ recognition (OR), zero-shot abnormality detection (AD), tumor detection (TD), and tumor segmentation (TS). Empirical results show that it outperforms its counterparts with global VL alignment. Compared to vanilla CLIP, CT-GLIP achieves average performance improvements of 15.1% of F1 score, 1.9% of AUC, and 3.2% of DSC for zero-shot AD, TD, and TS tasks, respectively. This study highlights the significance of grounded VL alignment in enabling 3D medical VL foundation models to understand sparse representations within CT scans.

研究动机与目标

  • 将医学视觉-语言预训练(Med-VLP)从 2D 图像扩展到更复杂且更具临床相关性的 3D 全身影像 CT 扫描,尽管受限于数据稀疏性和表征挑战,该领域仍研究不足。
  • 通过引入器官级别的视觉-文本对,解决将稀疏的 3D 视觉表征与精确的文本描述对齐的困难。
  • 通过构建异常词典,增加负样本对比对的数量和多样性,从而提升 3D 医学视觉-语言预训练中的对比学习效果。
  • 在多个器官和癌症类型中,验证视觉-文本对齐在零样本和微调场景下对器官分类、异常检测和肿瘤分割任务的有效性。
  • 基于来自 17,702 名患者的 44,011 个器官级别的图像-报告对,建立一个基准数据集和评估协议,涵盖 104 种器官。

提出的方法

  • 通过使用 TotalSegmentator 对 3D CT 扫描中的 104 种器官进行分割,构建器官级别的图像-文本对,实现精确的视觉-文本对齐。
  • 利用 LLaMA-2 和人工验证对放射科报告进行解析,提取器官特异性的诊断描述,生成简洁且具有上下文依据的文本组件。
  • 引入两种对比学习目标:器官-文本对齐用于理解基本解剖概念,异常-文本对齐用于病理学异常的零样本检测。
  • 构建异常词典以生成多样化的负样本文本描述,提升对比对的数量和多样性,从而改善表征学习。
  • 采用多模态对比损失联合训练 CNN 和视觉 Transformer(ViT)主干网络,支持在下游任务(如肿瘤分割和癌症筛查)中的迁移应用。
  • 在包含 700 例非增强 CT 扫描和组织病理学确诊肿瘤掩码的专用癌症筛查数据集上进行微调,评估模型性能。

实验结果

研究问题

  • RQ1基于器官级别的图像-文本对的 3D 视觉-语言预训练是否能提升全身影像 CT 扫描中器官和异常的零样本识别性能?
  • RQ2在训练样本数量有限的情况下,异常词典如何增强 3D 医学视觉-语言预训练中的对比学习?
  • RQ3在 3D 医学影像中,所提出的 CT-GLIP 框架是否在零样本和微调设置下均优于标准的全图报告对齐方式和原始 CLIP 模型?
  • RQ4CT-GLIP 在多癌种筛查任务(如非增强 CT 扫描中的肿瘤分割和检测)中,对下游性能的提升程度如何?
  • RQ5该模型是否能够仅通过自然语言描述,在零样本设置下泛化识别罕见或未见的异常?

主要发现

  • 在 1,130 名患者的测试集中,CT-GLIP 实现了 71.90% 的零样本异常检测 F1 分数,在 ViT 主干设置下相比原始 CLIP 提升 2.63%。
  • 在肿瘤分割的微调任务中,CT-GLIP 相比从零开始训练的模型,平均 Dice 分数提升 4.8%;相比使用原始 CLIP 微调的 nnUNet 主干网络,提升 1.3%。
  • 在癌症筛查任务中,CT-GLIP 的平均 AUC 分数相比从零开始训练提升 7.4%,相比使用原始 CLIP 微调的 nnUNet 主干网络提升 2.2%。
  • 在 MiT 主干网络上,CT-GLIP 相比从零开始训练的模型,平均肿瘤分割 Dice 分数提升 13.1%;相比使用原始 CLIP 微调的模型,提升 5.1%。
  • 在癌症检测任务中,CT-GLIP 的平均 AUC 分数相比从零开始训练的模型提升 7.7%,相比使用原始 CLIP 微调的 MiT 主干网络提升 1.6%。
  • 模型展现出强大的零样本泛化能力,在未进行微调的情况下,仅通过自然语言提示,成功识别出 86.24% 案例中的器官和异常。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。