Skip to main content
QUICK REVIEW

[论文解读] AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation

Junyang Wang, Yuhang Wang|arXiv (Cornell University)|Nov 13, 2023
Topic Modeling被引用 5
一句话总结

本文提出了 AMBER,一个无需大语言模型(LLM)的多维基准,用于在生成和判别任务中评估多模态大语言模型(MLLMs)中的幻觉现象。该基准实现了低成本、自动化的评估,无需依赖外部 LLM,可检测存在性、属性和关系幻觉,揭示了即使 GPT-4V 也存在显著的幻觉——尤其在属性和关系理解方面。

ABSTRACT

Despite making significant progress in multi-modal tasks, current Multi-modal Large Language Models (MLLMs) encounter the significant challenge of hallucinations, which may lead to harmful consequences. Therefore, evaluating MLLMs' hallucinations is becoming increasingly important in model improvement and practical application deployment. Previous works are limited in high evaluation costs (e.g., relying on humans or advanced LLMs) and insufficient evaluation dimensions (e.g., types of tasks and hallucinations). In this paper, we propose an LLM-free multi-dimensional benchmark AMBER, which can be used to evaluate both generative task and discriminative task including existence, attribute and relation hallucination. Based on AMBER, we design a low-cost and efficient evaluation pipeline. Additionally, we conduct a comprehensive evaluation and detailed analysis of mainstream MLLMs including GPT-4V(ision), and also give guideline suggestions for mitigating hallucinations. The data and code of AMBER are available at https://github.com/junyangwang0410/AMBER.

研究动机与目标

  • 解决现有幻觉评估基准依赖人工标注或先进 LLM 所导致的高成本和范围有限的问题。
  • 开发一个全面的、多维的基准,覆盖存在性、属性和关系等多种幻觉类型,并适用于生成和判别任务。
  • 设计一个无需 LLM 的自动化评估流程,以减少对外部昂贵模型的依赖,提升可扩展性。
  • 对主流 MLLM(包括 GPT-4V)进行实证分析,识别持续存在的幻觉模式,并指导缓解策略的制定。

提出的方法

  • 收集高质量、非训练图像的数据集,其中对象定义明确、视觉内容清晰,以最小化歧义。
  • 为每张图像标注精确的多层级标签,涵盖对象存在性、属性(如颜色、状态、数量)以及空间/时间关系。
  • 设计基于规则和自然语言处理技术(如 spaCy、NLTK)的自动化评估流程,将模型输出与真实标注进行对比,无需外部 LLM。
  • 实施任务特定的评估协议:对于生成任务,将生成文本与参考标注进行比较;对于判别任务,对存在性、属性和关系陈述进行二分类评估。
  • 使用 F1 分数和准确率作为主要指标,量化不同幻觉类型和任务中的幻觉率。
  • 将该基准应用于评估一系列 MLLM,包括 GPT-4V,以分析性能并识别失败模式。

实验结果

研究问题

  • RQ1完全基于 LLM 的基准能否有效评估 MLLM 在生成和判别任务中的幻觉?
  • RQ2主流 MLLM(包括 GPT-4V)在统一的多维基准上,对不同类型的幻觉——存在性、属性和关系——表现如何?
  • RQ3MLLM 在属性和关系幻觉中的主要失败模式是什么?这些模式在不同模型架构间如何变化?
  • RQ4无需依赖 LLM 的自动化、基于规则的评估流程在多大程度上能实现可靠的幻觉检测?

主要发现

  • AMBER 有效实现了无需 LLM 的自动化幻觉评估,适用于生成和判别任务,显著降低了评估成本并提升了可扩展性。
  • 即使是最先进的 MLLM GPT-4V,也表现出显著的幻觉,尤其在属性和关系理解方面,属性幻觉的 F1 分数约为 0.7,关系幻觉的 F1 分数约为 0.6。
  • MLLM 在涉及对象状态和数量的细粒度属性幻觉上表现较差,表明需要改进数据集构建,重点关注此类属性。
  • 相比之下,MLLM 在与动作相关的幻觉上表现相对较强,部分开源模型甚至在某些情况下优于 GPT-4V,表明其在动作理解方面学习效果较好。
  • 关系幻觉最为严重,大多数模型的准确率仅约 60%,可能由于关系描述的训练数据存在偏差或稀疏。
  • 该基准成功检测到 GPT-4V 中的幻觉,如错误的对象关系和虚假的属性声明,证实了其敏感性和可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。