[论文解读] MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation
MedXChat 是一个统一的多模态大语言模型框架,可使用单一指令微调的大语言模型实现从胸部X光片(CXR)到报告的端到端生成、视觉问答(VQA)以及文本到CXR的合成。在 MIMIC-CXR 数据集上,该框架在所有任务中均优于当前最先进模型,FID(43.46)、AUROC(0.87)和 BLEU-4(0.42)均达到最先进水平,且在生成临床准确、细粒度的侧位视图CXR方面表现出更优的保真度。
Multimodal Large Language Models (MLLMs) have shown success in various general image processing tasks, yet their application in medical imaging is nascent, lacking tailored models. This study investigates the potential of MLLMs in improving the understanding and generation of Chest X-Rays (CXRs). We introduce MedXChat, a unified framework facilitating seamless interactions between medical assistants and users for diverse CXR tasks, including text report generation, visual question-answering (VQA), and Text-to-CXR generation. Our MLLMs using natural language as the input breaks task boundaries, maximally simplifying medical professional training by allowing diverse tasks within a single environment. For CXR understanding, we leverage powerful off-the-shelf visual encoders (e.g., ViT) and LLMs (e.g., mPLUG-Owl) to convert medical imagery into language-like features, and subsequently fine-tune our large pre-trained models for medical applications using a visual adapter network and a delta-tuning approach. For CXR generation, we introduce an innovative synthesis approach that utilizes instruction-following capabilities within the Stable Diffusion (SD) architecture. This technique integrates smoothly with the existing model framework, requiring no extra parameters, thereby maintaining the SD's generative strength while also bestowing upon it the capacity to render fine-grained medical images with high fidelity. Through comprehensive experiments, our model demonstrates exceptional cross-task adaptability, displaying adeptness across all three defined tasks. Our MedXChat model and the instruction dataset utilized in this research will be made publicly available to encourage further exploration in the field.
研究动机与目标
- 开发一个统一的多模态框架,实现在临床环境中CXR图像理解与生成及自然语言交互的无缝集成。
- 克服现有模型依赖向量量化(VQ)所带来的局限性,避免量化误差和固定码书约束。
- 通过不重新训练扩散模型或转换文本为图像标记,直接利用Stable Diffusion的指令遵循能力,实现无需微调的高保真度、基于指令的文本到CXR图像合成。
- 通过利用CLIP封闭区域特征和基于大语言模型(LLM)的指令微调,提升跨任务适应性和临床相关性。
- 在生成和理解任务中支持前后位(PA)和侧位(LAT)CXR视图,提升诊断完整性。
提出的方法
- MedXChat 使用 CLIP 封闭区域特征,而非基于 VQ 的图像标记,以更好地对齐细粒度医学数据的视觉与文本表示。
- 采用仅文本的 LLM(ChatGPT-4)作为教师模型,生成参考图像和报告的指令微调对话数据,用于端到端多模态微调。
- 在文本到CXR图像合成任务中,直接利用 Stable Diffusion 的指令遵循能力,绕过图像标记级别的图文对齐,避免对扩散模型进行完整微调。
- 该框架在 MIMIC-CXR 数据集上进行端到端训练,支持三项核心任务:CXR到报告生成、VQA 和 文本到CXR图像生成。
- 通过基于提示的指令微调整合视觉与语言模态,避免使用独立的模型头或参数高效适配器。
- 采用标准指标进行评估,包括 BLEU、ROUGE、METEOR、CIDEr、FID、AUROC 和诊断分类准确率。
实验结果
研究问题
- RQ1统一的多模态大语言模型框架是否能在单一架构中实现CXR到报告生成、VQA和文本到CXR图像合成任务的最先进性能?
- RQ2将基于VQ的图像标记化替换为CLIP封闭区域特征,是否能提升医学多模态任务中的性能与泛化能力?
- RQ3指令微调的大语言模型在多大程度上能生成临床准确、细粒度的CXR图像,包括正确的解剖视图(如侧位)和病理特征?
- RQ4利用Stable Diffusion原生的指令遵循能力,是否能实现高保真度、参数高效的文本到CXR图像生成,而无需额外的图像标记化?
- RQ5MedXChat 在捕捉临床相关模式方面,与现有模型相比表现如何,特别是在双侧肺水肿或胸腔积液等复杂病例中?
主要发现
- 在文本到CXR图像生成任务中,MedXChat 的 FID 得分为 43.46,显著优于 LLM-CXR(73.29)和 UniXGen(106.17),表明其图像质量更高,且与真实CXR的分布更接近。
- 在诊断分类任务中,MedXChat 的 AUROC 达到 0.87,优于 LLM-CXR(0.85)和 UniXGen(0.78),表明其更能捕捉临床相关信息特征。
- 在CXR到报告生成任务中,MedXChat 的 BLEU-4 得分为 0.42,优于 LLM-CXR 和所有传统基线模型,在 BLEU-1 至 BLEU-3 及 METEOR 指标上也表现优异。
- 在VQA任务中,MedXChat 整体准确率最高,其中病灶存在判断准确率达 92.1%,解剖位置判断为 89.3%,SST(大小、严重程度、类型)判断为 87.6%,在所有类别中均超过其他模型。
- 该模型成功生成了高保真度的侧位视图CXR,能准确呈现双侧肺水肿和胸腔积液等病理特征,而 LLM-CXR 和 UniXGen 仅限于前后位视图。
- 定性分析表明,MedXChat 生成的报告在发现和结论部分与原始报告高度一致,而 LLM-CXR 仅生成简短的结论部分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。