Skip to main content
QUICK REVIEW

[论文解读] VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models

Yuxuan Wang, Yueqian Wang|arXiv (Cornell University)|Jun 24, 2024
Schizophrenia research and treatment被引用 4
一句话总结

该论文提出了VideoHallucer,这是首个用于评估大规模视频-语言模型(LVLMs)中内在幻觉与外在幻觉的综合性基准。通过采用对抗性二元视频问答(VideoQA)设置,并配对使用基础问题与幻觉问题,研究发现当前LVLMs普遍存在幻觉问题,尤其在检测外在事实性幻觉方面表现不佳,且扩大数据量和参数规模对这类问题的改善作用有限。自监督的self-PEP框架进一步将幻觉抵抗能力平均提升了5.38%。

ABSTRACT

Recent advancements in Multimodal Large Language Models (MLLMs) have extended their capabilities to video understanding. Yet, these models are often plagued by "hallucinations", where irrelevant or nonsensical content is generated, deviating from the actual video context. This work introduces VideoHallucer, the first comprehensive benchmark for hallucination detection in large video-language models (LVLMs). VideoHallucer categorizes hallucinations into two main types: intrinsic and extrinsic, offering further subcategories for detailed analysis, including object-relation, temporal, semantic detail, extrinsic factual, and extrinsic non-factual hallucinations. We adopt an adversarial binary VideoQA method for comprehensive evaluation, where pairs of basic and hallucinated questions are crafted strategically. By evaluating eleven LVLMs on VideoHallucer, we reveal that i) the majority of current models exhibit significant issues with hallucinations; ii) while scaling datasets and parameters improves models' ability to detect basic visual cues and counterfactuals, it provides limited benefit for detecting extrinsic factual hallucinations; iii) existing models are more adept at detecting facts than identifying hallucinations. As a byproduct, these analyses further instruct the development of our self-PEP framework, achieving an average of 5.38% improvement in hallucination resistance across all model architectures.

研究动机与目标

  • 为解决大规模视频-语言模型(LVLMs)中幻觉现象缺乏全面评估的问题,特别是由动作与事件等动态内容引发的幻觉。
  • 建立LVLM中幻觉现象的清晰分类体系,区分内在幻觉(与视频内容矛盾)与外在幻觉(无法从视频中验证),并进一步细分为子类别以支持深入分析。
  • 设计一种稳健的对抗性二元视频问答评估框架,最大限度减少语言偏见,提升幻觉检测的可靠性。
  • 通过实证分析11个最先进LVLM的幻觉脆弱性,揭示扩大训练数据与模型参数的局限性。
  • 基于基准研究结果,指导开发更优的防御机制,如self-PEP框架。

提出的方法

  • 提出两级幻觉分类体系:内在幻觉(与视频内容不一致)与外在幻觉(无法从视频中验证),并细分为五种子类型:对象关系、时间、语义细节、外在事实性与外在非事实性。
  • 设计对抗性二元视频问答评估协议,每段视频均配对一个基础问题与一个幻觉版本问题,确保‘是’与‘否’回答平衡,以减少语言偏见。
  • 构建高质量、人工标注的问题对,并附带详细解释注释,以提升评估过程中的清晰度并减少误解。
  • 采用二元分类设置,要求模型区分基础问题(正确)与幻觉问题,分别测量其在两类问题上的准确率。
  • 提出self-PEP框架,一种自监督的数据增强与微调方法,通过在对抗性样本上的模型预测结果进行学习,提升幻觉抵抗能力。
  • 在所有VideoHallucer类别中评估11个LVLM,包括内在与外在幻觉,并采用标准化指标与消融实验分析规模扩展的影响。

实验结果

研究问题

  • RQ1当在动态视频内容上进行推理时,当前大规模视频-语言模型在多大程度上表现出内在与外在幻觉?
  • RQ2扩大模型规模与训练数据量在多大程度上影响不同幻觉类型(尤其是外在事实性幻觉)的检测能力?
  • RQ3为何模型在识别事实方面表现优于检测幻觉?其根本原因是什么?
  • RQ4像self-PEP这样的自监督框架能否有效提升多种LVLM架构的幻觉抵抗能力?
  • RQ5在各类幻觉子类型中,人类水平表现与模型水平表现相比如何?

主要发现

  • 当前大多数LVLM存在显著的幻觉问题,人类与模型在VideoHallucer所有设置中的性能差距均十分明显。
  • 扩大模型参数与训练数据量可提升对基础视觉线索与反事实幻觉的检测能力,但对检测外在事实性幻觉的改善作用有限。
  • 模型在识别事实方面始终比检测幻觉更擅长,表明其推理能力存在根本性不对称。
  • self-PEP框架在所有评估的模型架构上平均提升了5.38%的幻觉抵抗能力,证明其有效性。
  • Gemini-1.5-Pro在幻觉问题上的整体准确率最高(外在事实性类型达64%),但仍远未达到人类水平。
  • LLaMA-VID与VideoLaVIT在基础问题上表现强劲(准确率分别为98%与97.5%),但在幻觉问题上表现极差(准确率分别为2.5%与6%),凸显其对幻觉的高度敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。