[论文解读] Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
本文提出CLIP引导解码(CGD),一种无需训练的方法,通过使用CLIP分数来指导句子级别的解码,从而减少大型视觉-语言模型(LVLMs)中的对象幻觉。通过优先选择与输入图像具有更高CLIP相似度的生成句子,CGD显著降低了幻觉——在幻觉分数上实现了33.5%的相对减少——同时保持了生成质量,且无需模型微调或外部工具。
Large Vision-Language Models (LVLMs) are susceptible to object hallucinations, an issue in which their generated text contains non-existent objects, greatly limiting their reliability and practicality. Current approaches often rely on the model's token likelihoods or other internal information, instruction tuning on additional datasets, or incorporating complex external tools. We first perform empirical analysis on sentence-level LVLM hallucination, finding that CLIP similarity to the image acts as a stronger and more robust indicator of hallucination compared to token likelihoods. Motivated by this, we introduce our CLIP-Guided Decoding (CGD) approach, a straightforward but effective training-free approach to reduce object hallucination at decoding time. CGD uses CLIP to guide the model's decoding process by enhancing visual grounding of generated text with the image. Experiments demonstrate that CGD effectively mitigates object hallucination across multiple LVLM families while preserving the utility of text generation. Codes are available at https://github.com/d-ailin/CLIP-Guided-Decoding.
研究动机与目标
- 探究LVLM中对象幻觉的根本原因,特别是后期句子生成中的情况。
- 评估CLIP相似度是否作为幻觉指标,相较于模型内部似然度更具鲁棒性。
- 开发一种无需训练、轻量级的方法,在解码过程中利用CLIP作为外部引导,改善幻觉缓解。
- 在减少幻觉的同时保持生成质量,特别是在安全关键场景和人机交互设置中。
提出的方法
- 该方法提出CLIP引导解码(CGD),在解码过程中利用CLIP根据候选句子与输入图像的视觉-语义对齐程度对其进行评分。
- 在每个解码步骤中,生成多个候选句子,并计算其CLIP分数以评估其与图像的对齐程度。
- 幻觉分数被计算为句子似然度与CLIP分数的加权组合,CLIP分数越高,候选句子优先级越高。
- 最终输出通过可微重排序机制从最高分候选中选择,该机制强调视觉定位。
- 该方法完全在推理阶段进行,无需模型微调或额外训练。
- 该方法在独立于LVLM使用的CLIP模型以及与LVLM使用相同CLIP模型的情况下均进行了评估,证明了其在不同配置下的鲁棒性。
实验结果
研究问题
- RQ1在LVLM中,CLIP相似度是否比标记似然度更强且更可靠的幻觉指示器?
- RQ2使用CLIP分数引导解码是否能减少开放域图像字幕生成中的幻觉?
- RQ3像CGD这样的无需训练、外部引导的方法能否有效缓解幻觉而不损害生成质量?
- RQ4CGD在不同CLIP模型上的表现如何,包括那些与LVLM本身使用的模型相同的情况?
- RQ5在不同LVLM中,生成字幕的后期句子是否会出现显著的幻觉增加?
主要发现
- CLIP分数是比标记似然度更强且更鲁棒的幻觉指示器,尤其在字幕的后期句子中表现更显著。
- 与贪婪解码相比,CGD将幻觉减少了33.5%,在COCO数据集上达到29.73的幻觉分数,在NoCaps数据集上达到8.12。
- 消融研究证实,CLIP引导在幻觉减少中起主导作用,若移除CLIP引导,性能会退化至接近贪婪解码水平。
- 即使重用LVLM中已有的CLIP模型(如OpenAI ViT-L/14),CGD仍优于基线解码方法,表明现有微调存在过拟合问题。
- 增加候选数(N)和采样次数(M)可提升性能,表明结合CLIP引导的更广泛搜索能增强幻觉缓解效果。
- 该方法保持了生成质量,平均字幕长度仅从贪婪解码的80.05略微减少至CGD的76.66,表明对实用性的降级极小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。