[论文解读] Improving Zero-Shot Detection of Low Prevalence Chest Pathologies using Domain Pre-trained Language Models
本文提出用领域预训练的语言模型(如 CXR-BERT、ClinicalBERT)替换零样本胸部X光病理检测中基于CLIP的文本塔,以提升对低流行率病灶的性能。尽管在常见疾病上性能有所下降,但领域优化的文本编码器显著提升了罕见病种的AUC,最高提升达0.15,尤其在肺肿瘤和锁骨骨折等病种中表现突出,证明其在低资源场景下的优越性。
Recent advances in zero-shot learning have enabled the use of paired image-text data to replace structured labels, replacing the need for expert annotated datasets. Models such as CLIP-based CheXzero utilize these advancements in the domain of chest X-ray interpretation. We hypothesize that domain pre-trained models such as CXR-BERT, BlueBERT, and ClinicalBERT offer the potential to improve the performance of CLIP-like models with specific domain knowledge by replacing BERT weights at the cost of breaking the original model's alignment. We evaluate the performance of zero-shot classification models with domain-specific pre-training for detecting low-prevalence pathologies. Even though replacing the weights of the original CLIP-BERT degrades model performance on commonly found pathologies, we show that pre-trained text towers perform exceptionally better on low-prevalence diseases. This motivates future ensemble models with a combination of differently trained language models for maximal performance.
研究动机与目标
- 解决由于图像-报告对齐数据集中曝光不足,导致在低流行率胸部病灶上零样本性能较差的问题。
- 探究对文本塔进行领域特定预训练是否能提升对罕见病灶的零样本检测性能。
- 评估将CLIP的一般性文本编码器替换为医学领域专用模型后,在常见病与罕见病之间性能权衡的影响。
- 确定领域预训练的文本编码器是否能在低资源、零样本医学影像场景中超越标准CLIP基线模型。
提出的方法
- 将CheXzero中的CLIP文本塔替换为领域预训练的语言模型:CXR-BERT、BlueBERT 和 ClinicalBERT,所有模型均在MIMIC-CXR上进行微调。
- 使用对比学习通过对比损失函数对齐图像与文本嵌入,训练5个周期,批量大小为32,基础初始学习率为5e-6。
- 通过可学习的投影头将所有文本编码器的最终嵌入维度标准化为128,以确保与视觉塔的兼容性。
- 在VinDr-CXR数据集上进行零样本推理,使用正样本和负样本提示计算logits,以预测病灶概率。
- 与使用CLIP权重初始化的CheXzero基线模型进行对比,使用AUC作为12种病灶的主要评估指标。
- 使用自 resampling 的置信区间评估各病灶性能差异的统计显著性。
实验结果
研究问题
- RQ1将CLIP文本塔替换为领域预训练语言模型,是否能提升对低流行率胸部X光病灶的零样本检测性能?
- RQ2与基于CLIP的基线相比,文本编码器中使用领域特定预训练是否会导致在高流行率病灶上的性能下降?
- RQ3对于在MIMIC-CXR训练集中提及次数少于100次的病灶,CXR-BERT和ClinicalBERT等领域预训练文本编码器在多大程度上优于基于CLIP的基线?
- RQ4即使在对齐数据中罕见病灶提及频率极低,领域预训练的文本编码器是否仍能有效泛化到这些罕见病灶?
- RQ5是否存在一种可行策略,将领域预训练与通用文本编码器结合,以在常见与罕见病灶上均实现最佳性能?
主要发现
- 在MIMIC-CXR训练集中仅被提及一次的肺肿瘤病灶上,CXR-BERT相比CheXzero基线AUC提升0.15。
- ClinicalBERT在所有低流行率病灶上的AUC平均提升达0.08,优于基线。
- 对于锁骨骨折(69次提及),CXR-BERT的AUC达到0.853,显著优于基线的0.664。
- 在肺炎和胸腔积液等高流行率病灶上,CheXzero基线平均优于CXR-BERT和ClinicalBERT 0.05–0.12 AUC。
- BlueBERT在所有病灶上表现均较差,表明并非所有领域预训练模型都能带来性能增益,模型选择至关重要。
- 结果表明,由于在PubMed和MIMIC-III等医学语料库中经历了更广泛的预训练,领域预训练的文本编码器在罕见病灶上尤为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。