[论文解读] Effectively Fine-tune to Improve Large Multimodal Models for Radiology Report Generation
本文提出一种两阶段微调策略,通过软视觉提示将视觉特征对齐到文本嵌入空间,以提升大型多模态模型在放射科报告生成中的表现。采用该方法的OpenLLaMA-7B模型在无需领域特定预训练的情况下,实现了最先进性能,F1-CheXBert评分显示事实正确性显著提升。
Writing radiology reports from medical images requires a high level of domain expertise. It is time-consuming even for trained radiologists and can be error-prone for inexperienced radiologists. It would be appealing to automate this task by leveraging generative AI, which has shown drastic progress in vision and language understanding. In particular, Large Language Models (LLM) have demonstrated impressive capabilities recently and continued to set new state-of-the-art performance on almost all natural language tasks. While many have proposed architectures to combine vision models with LLMs for multimodal tasks, few have explored practical fine-tuning strategies. In this work, we proposed a simple yet effective two-stage fine-tuning protocol to align visual features to LLM's text embedding space as soft visual prompts. Our framework with OpenLLaMA-7B achieved state-of-the-art level performance without domain-specific pretraining. Moreover, we provide detailed analyses of soft visual prompts and attention mechanisms, shedding light on future research directions.
研究动机与目标
- 在无需领域特定预训练的情况下,提升大型语言模型(LLMs)在放射科报告生成中的临床准确性。
- 解决有效对齐视觉特征与LLM文本嵌入空间以实现多模态生成的挑战。
- 探究微调视觉编码器是否相比冻结视觉编码器能提升性能,与常见做法相反。
- 分析大型模型中的注意力机制,以理解其对视觉输入的对齐程度。
- 提供一种实用且可扩展的框架,用于在医学报告生成中利用现成的大型语言模型。
提出的方法
- 一个轻量级映射网络,以单个Transformer解码器层实现,将视觉编码器的视觉特征投影到因果语言模型的文本嵌入维度。
- 该映射网络同时执行注意力池化(将225个视觉标记减少至10个)和特征投影,以匹配语言模型的嵌入大小。
- 投影后的视觉特征被视作软视觉提示,并作为条件输入到语言模型的自回归生成过程中。
- 引入两阶段微调协议:首先微调映射网络,然后在保持LLM冻结的前提下,联合微调视觉编码器和映射网络。
- 通过在层和样本之间对注意力权重进行归一化与平均,测量每个生成标记对软视觉提示的关注程度。
- 使用F1-CheXBert指标评估事实完整性,通过基于CheX-BERT的标注器将模型生成的报告与真实报告进行比较。

实验结果
研究问题
- RQ1与冻结视觉编码器相比,微调视觉编码器是否能提升放射科报告生成的性能?
- RQ2不同尺寸的大型语言模型中,对软视觉提示的注意力分配如何变化?
- RQ3两阶段微调协议是否能增强基于LLM的报告生成在事实正确性和临床有效性方面的表现?
- RQ4为何在模型规模扩大(如从GPT2到OpenLLaMA-7B)时,性能提升趋于平缓,尽管验证损失持续降低?
- RQ5在生成放射科报告时,大型LLM在多大程度上与视觉输入保持对齐?
主要发现
- 两阶段微调策略在所有模型尺寸上平均提升了1.9分的F1-CheXBert-14得分。
- 即使BioVIL-T拥有两倍于MIMIC-CXR数据量并经过领域特定预训练,OpenLLaMA-7B在两阶段微调后仍表现更优。
- OpenLLaMA-7B对软视觉提示的注意力分配显著低于较小的GPT2模型,表明大型模型中视觉对齐能力较弱。
- 生成报告之间的平均成对相似性随OpenLLaMA-7B增大,表明仅靠语言建模损失无法有效按类别区分视觉特征。
- 该模型在无需任何领域特定预训练的情况下,于NLG和临床评估指标上均达到最先进性能。
- 注意力权重可视化证实,如OpenLLaMA-7B等大型LLM对视觉提示的依赖性较低,凸显了多模态对齐中的关键挑战。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。