Skip to main content
QUICK REVIEW

[论文解读] Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance

Linxi Zhao, Yihe Deng|arXiv (Cornell University)|Feb 13, 2024
Epilepsy research and treatment被引用 4
一句话总结

该论文提出 MARINE,一种无需训练且无需 API 的框架,通过在生成过程中利用分类器自由引导(classifier-free guidance)整合预训练视觉模型的物体定位特征,以减轻大型视觉语言模型(LVLMs)中的对象幻觉问题。该方法在减少幻觉的同时提升了响应的细节和保真度,在使用 CHAIR、POPE 和 GPT-4V 评估的六种 LVLM 上,优于基于微调和生成后修正的方法。

ABSTRACT

The advancement of Large Vision-Language Models (LVLMs) has increasingly highlighted the critical issue of their tendency to hallucinate non-existing objects in the images. To address this issue, previous works focused on using specially curated datasets or powerful LLMs to rectify the outputs of LVLMs. However, these approaches require either costly training or fine-tuning, or API access to proprietary LLMs for post-generation correction. In response to these limitations, we propose Mitigating hallucinAtion via image-gRounded guIdaNcE (MARINE), a framework that is both training-free and API-free. MARINE effectively and efficiently reduces object hallucinations during inference by introducing image-grounded guidance to LVLMs. This is achieved by leveraging open-source vision models to extract object-level information, thereby enhancing the precision of LVLM-generated content. Our framework's flexibility further allows for the integration of multiple vision models, enabling more reliable and robust object-level guidance. Through comprehensive evaluations across 5 popular LVLMs with diverse evaluation metrics and benchmarks, we demonstrate the effectiveness of MARINE, which even outperforms existing fine-tuning-based methods. Remarkably, it reduces hallucinations consistently in GPT-4V-assisted evaluation while maintaining the detailedness of LVLMs' generations. We release our code at https://github.com/Linxi-ZHAO/MARINE.

研究动机与目标

  • 解决大型视觉语言模型(LVLMs)中对象幻觉的关键问题,即模型会生成不存在于图像中的对象描述。
  • 开发一种无需训练且无需 API 的解决方案,避免依赖昂贵的微调或 GPT-3.5 等外部 LLM API。
  • 在生成过程中减少幻觉的同时,保持 LVLM 输出的原始风格和指令遵循性。
  • 通过利用预训练检测器提供的物体定位特征,丰富视觉上下文,提升 LVLM 输出的精确度和细节。
  • 证明在生成过程中进行修正比生成后修正更有效且干扰更小。

提出的方法

  • MARINE 集成一个预训练的物体检测模型(如 DETR),以提取能够定位图像中物体存在的视觉特征。
  • 这些物体定位特征被投影为一种软提示,并在生成过程中注入 LVLM 的交叉注意力层。
  • 应用分类器自由引导(CFG),并使用引导强度 γ 控制定位特征对文本生成的影响。
  • 该引导机制促使 LVLM 生成与增强视觉特征一致的文本,从而减少幻觉内容。
  • 该框架兼容任何视觉模型和投影函数,支持灵活部署。
  • 评估采用 CHAIR、POPE 和 GPT-4V 辅助评估,以衡量幻觉减少程度和响应细节。

实验结果

研究问题

  • RQ1一种无需训练且无需 API 的方法是否能在生成过程中有效减少 LVLM 中的对象幻觉?
  • RQ2通过分类器自由引导整合物体定位特征,如何提升 LVLM 输出的精确度和事实一致性?
  • RQ3在生成过程中修正幻觉是否比生成后修正更能保持原始风格和指令遵循性?
  • RQ4物体定位特征的引导强度和噪声强度如何影响幻觉减少和响应质量?
  • RQ5MARINE 是否能在幻觉减少和详细响应生成方面优于现有的基于微调和生成后修正的方法?

主要发现

  • MARINE 在六种 LVLM 上显著减少了幻觉,其在 CHAIR 和 POPE 指标上优于最先进的生成后修正方法(如 Woodpecker 和 LURE)。
  • 在引导强度为 0.5 时,MARINE 相较于基线,在 LLaVA-v1.5 上通过 CHAIR 测量实现了 23.1% 的幻觉相对减少。
  • MARINE 提升了响应细节,GPT-4V 评估显示其在事实正确性和细节保留方面相比基线提升了 15.6%。
  • 消融研究证实,引导强度 γ ∈ (0.3, 0.7) 时可实现最佳幻觉减少效果,更高值虽提升保真度但会降低多样性。
  • 物体检测器的噪声强度(通过置信度阈值控制)会影响性能,但 MARINE 搭配 DETR(γ=0.5)在所有阈值下仍优于 LURE 和 Woodpecker。
  • 定性结果表明,MARINE 保持了原始响应风格和指令遵循性,而 Woodpecker 和 LURE 经常会覆盖或扭曲原始输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。