Skip to main content
QUICK REVIEW

[论文解读] Text-guided Foundation Model Adaptation for Pathological Image Classification

Yunkun Zhang, Jin Gao|arXiv (Cornell University)|Jul 27, 2023
Topic Modeling被引用 4
一句话总结

本文提出 CITE,一种数据高效的方法,通过连接预训练基础模型的图像与文本嵌入,提升病理图像分类性能。通过注入冻结语言模型中的生物医学文本知识,并仅微调视觉编码器中的少量参数,CITE 在低数据设置下实现最先进性能,展现出强大的泛化能力与对多种主干模型的兼容性。

ABSTRACT

The recent surge of foundation models in computer vision and natural language processing opens up perspectives in utilizing multi-modal clinical data to train large models with strong generalizability. Yet pathological image datasets often lack biomedical text annotation and enrichment. Guiding data-efficient image diagnosis from the use of biomedical text knowledge becomes a substantial interest. In this paper, we propose to Connect Image and Text Embeddings (CITE) to enhance pathological image classification. CITE injects text insights gained from language models pre-trained with a broad range of biomedical texts, leading to adapt foundation models towards pathological image understanding. Through extensive experiments on the PatchGastric stomach tumor pathological image dataset, we demonstrate that CITE achieves leading performance compared with various baselines especially when training data is scarce. CITE offers insights into leveraging in-domain text knowledge to reinforce data-efficient pathological image classification. Code is available at https://github.com/Yunkun-Zhang/CITE.

研究动机与目标

  • 通过利用预训练的生物医学文本知识,解决病理图像分类中的数据稀缺问题。
  • 在不微调整个主干网络的情况下,实现基础模型在医学影像上的高效适配。
  • 通过文本嵌入实现多模态对齐,弥合自然图像与病理图像之间的领域差距。
  • 开发一种与模型无关的框架,兼容多种预训练视觉与语言编码器。
  • 证明在域内生物医学文本可替代少样本设置下的传统分类头。

提出的方法

  • CITE 通过将视觉编码器的视觉特征投影,并与冻结的生物医学语言模型生成的文本嵌入对齐,连接图像与文本嵌入。
  • 引入可学习的视觉提示和投影头,以在保持预训练主干网络冻结的同时适配视觉编码器。
  • 文本嵌入来自如 BioBERT 和 BioLinkBERT 等预训练生物医学语言模型,且应用停止梯度以保护知识完整性。
  • 通过图像与文本嵌入之间的余弦相似度执行分类,实现仅视觉提示和投影头的端到端训练。
  • 该方法兼容多种视觉编码器(如 CLIP、ImageNet-21k、INTERN)和语言编码器,支持灵活集成。
  • CITE 通过利用预训练的单模态编码器并在适配阶段注入领域特定的文本知识,避免了联合预训练。

实验结果

研究问题

  • RQ1在数据稀缺条件下,预训练的生物医学文本知识是否能提升基础模型在病理图像分类中的性能?
  • RQ2在少样本设置下,文本引导的适配与传统微调和提示调优相比表现如何?
  • RQ3在不进行联合预训练的情况下,冻结的生物医学语言模型在多大程度上能增强视觉表征学习?
  • RQ4视觉提示学习与域内文本知识的结合是否能在低数据环境下产生协同增益?
  • RQ5CITE 框架在不同视觉与语言主干架构上的泛化能力如何?

主要发现

  • 在仅每类 16 张幻灯片的 PatchGastric 数据集上,CITE 达到 68.7% 的 top-1 准确率,显著优于线性探测(65.4%)和微调(66.3%)基线。
  • 仅使用每类一张幻灯片时,CITE 使用 CLIP 文本编码器达到 60.1% 准确率,而线性探测为 47.7%,微调仅为 39.1%。
  • 使用 BioLinkBERT 作为文本编码器时,CITE 在使用全部训练数据的情况下达到 69.7% 准确率,比次优方法高出 3.4 个百分点。
  • CITE 在所有数据规模(每类 1 至 16 张样本)和所有测试的视觉与语言编码器组合下,始终优于所有基线方法。
  • 消融研究证实,视觉提示学习与生物医学文本知识均不可或缺,其中文本知识在极端低数据设置下贡献最大。
  • 该框架表现出强大的兼容性,在多种视觉编码器(CLIP、ImageNet-21k、INTERN)和语言模型(CLIP、BioBERT、BioLinkBERT)上均实现最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。