[论文解读] PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
该论文提出了PhD,一个用于评估大视觉语言模型(LVLMs)中内在视觉-语言幻觉(IVL-Hallu)的新基准数据集。它提出了一种四类幻觉类型分类法——对象、属性、多模态冲突和违背常识——并采用基于提示的自动化管道生成高质量、多样化的幻觉实例。在五种最先进LVLM上的大量实验表明,所有幻觉类型均出现显著性能下降,凸显了模型在LLM先验知识和模态不平衡影响下对幻觉的高度敏感性。
Multimodal Large Language Models (MLLMs) hallucinate, resulting in an emerging topic of visual hallucination evaluation (VHE). This paper contributes a ChatGPT-Prompted visual hallucination evaluation Dataset (PhD) for objective VHE at a large scale. The essence of VHE is to ask an MLLM questions about specific images to assess its susceptibility to hallucination. Depending on what to ask (objects, attributes, sentiment, etc.) and how the questions are asked, we structure PhD along two dimensions, i.e. task and mode. Five visual recognition tasks, ranging from low-level (object / attribute recognition) to middle-level (sentiment / position recognition and counting), are considered. Besides a normal visual QA mode, which we term PhD-base, PhD also asks questions with specious context (PhD-sec) or with incorrect context ({PhD-icc), or with AI-generated counter common sense images (PhD-ccs). We construct PhD by a ChatGPT-assisted semi-automated pipeline, encompassing four pivotal modules: task-specific hallucinatory item (hitem) selection, hitem-embedded question generation, specious / incorrect context generation, and counter-common-sense (CCS) image generation. With over 14k daily images, 750 CCS images and 102k VQA triplets in total, PhD reveals considerable variability in MLLMs' performance across various modes and tasks, offering valuable insights into the nature of hallucination. As such, PhD stands as a potent tool not only for VHE but may also play a significant role in the refinement of MLLMs.
研究动机与目标
- 解决现有研究中对LVLM中除对象幻觉外其他多样化内在幻觉类型的系统性评估不足的问题。
- 识别并分类四种不同类型的视觉-语言幻觉:对象、属性、多模态冲突和违背常识的幻觉。
- 开发一种自动化、基于提示的管道,用于生成涵盖这些类别的高质量、多样化幻觉数据。
- 评估最先进LVLM在这些幻觉类型上的鲁棒性,并揭示其失败的根本原因。
- 通过揭示LLM先验知识和模态不平衡的作用,为未来幻觉缓解研究提供基础。
提出的方法
- 基于其成因和在LVLM输出中的表现,提出四种内在幻觉类型(对象、属性、多模态冲突、违背常识)的分类法。
- 设计一种自动化、基于提示的数据生成管道,通过操控视觉和文本输入系统性地生成特定类型的幻觉实例。
- 利用易混淆的物体-属性配对(如金属茶壶与陶瓷茶壶)生成高质量的对象和属性幻觉数据。
- 通过构造与图像内容矛盾的问题(采用是/否和开放式两种格式)来创建多模态冲突幻觉,以测试模型鲁棒性。
- 通过将违背常识的图像(如比猫还大的老鼠)与触发LLM推理的文本问题配对,构建违背常识的幻觉。
- 在零样本和少样本设置下,使用PhD基准评估五种SOTA LVLM(如LLaVA、Qwen-VL)的幻觉率和性能下降情况。
实验结果
研究问题
- RQ1不同类型的内在幻觉——对象、属性、多模态冲突和违背常识——在LVLM中如何表现?
- RQ2最先进LVLM在上述四类幻觉中未能检测和避免幻觉的程度如何?
- RQ3模态不平衡和LLM先验知识在LVLM中如何促进幻觉的产生?
- RQ4当视觉和文本输入冲突时,文本提示的语气或措辞在多大程度上会加剧幻觉?
- RQ5基于提示的自动化数据生成能否有效生成多样化、高质量的幻觉实例,以用于LVLM鲁棒性基准测试?
主要发现
- LLaVA在开放式多模态冲突问题上的表现从89.3%骤降至10.9%,表明当视觉与文本输入冲突时,模型严重无法识别无法回答的问题。
- Qwen-VL对多模态冲突问题表现出更强的鲁棒性,可能归因于其针对性的对抗性训练,表明模型架构和训练方式可缓解幻觉。
- 属性幻觉的模型表现始终低于对象幻觉,表明细粒度属性理解更具挑战性且更容易出错。
- 违背常识的幻觉导致强烈的幻觉响应,证实当常识被违反时,LLM通常依赖内部知识而非图像内容。
- 文本语气的强烈程度显著影响幻觉率,更强的文本线索会增加模型对文本的依赖,降低与图像内容的一致性。
- 所有五种SOTA LVLM在四类幻觉中均表现出显著的幻觉率,揭示了其根本性脆弱性,根源在于模态不平衡和LLM先验知识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。