[论文解读] Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization
该论文提出了一种新型方法——幻觉感知直接偏好优化(Hallucination-Aware Direct Preference Optimization, HA-DPO),通过从成对的(正样本,负样本)图文响应中学习,训练视觉语言模型偏好非幻觉性响应。HA-DPO 显著减少了幻觉现象——将 MiniGPT-4 在 POPE 上的准确率从 51.13% 提升至 86.13%,MME 得分从 932.00 提升至 1326.46——同时通过在小规模、高质量的幻觉感知响应对数据集上进行高效偏好学习,提升了模型的泛化能力。
Multimodal large language models have made significant advancements in recent years, yet they still suffer from a common issue known as the "hallucination problem", in which the models generate textual descriptions that inaccurately depict or entirely fabricate content from associated images. This paper introduces a novel solution, Hallucination-Aware Direct Preference Optimization (HA-DPO), which reframes the hallucination problem as a preference selection task. The model is trained to favor the non-hallucinating response when presented with two responses of the same image (one accurate and one hallucinatory). Furthermore, this paper proposes an efficient pipeline for constructing positive~(non-hallucinatory) and negative~(hallucinatory) sample pairs, ensuring a high-quality, style-consistent dataset for robust preference learning. When applied to three mainstream multimodal models, HA-DPO significantly reduced hallucination issues and amplified the models' generalization capabilities. Notably, the MiniGPT-4 model, when enhanced with HA-DPO, demonstrated a substantial improvement: POPE accuracy rose from 51.13% to 86.13% (an absolute improvement of 35%), and the MME score surged from 932.00 to 1326.46 (a relative improvement of 42.32%). The codes, models, and datasets are made accessible at https://opendatalab.github.io/HA-DPO.
研究动机与目标
- 为解决大型视觉语言模型(LVLMs)中持续存在的幻觉问题,即模型对图像生成事实性错误的描述。
- 通过将幻觉减少重构为偏好学习问题,克服现有方法的局限性——如监督微调中的高数据/标注成本,以及后处理修正方法对外部工具的依赖。
- 开发一种可扩展、高效且有效的训练流程,在无需大量数据或外部工具的前提下,最小化幻觉现象的同时提升模型泛化能力。
- 提出一种全新的综合评估指标——句子级幻觉比率(Sentence-level Hallucination Ratio, SHR),用于细粒度、类别无关的幻觉测量。
提出的方法
- 将幻觉减少重构为直接偏好优化(DPO)任务,模型在给定同一图像的两个响应时,学习偏好非幻觉性响应而非幻觉性响应。
- 提出一种数据构建流程,生成风格一致的正样本(非幻觉性)和负样本(幻觉性)响应对,确保训练稳定性和模型对齐。
- 采用 DPO 方法,使用偏好损失函数优化策略模型,使其与参考模型对非幻觉输出的偏好保持一致,从而减少对强化学习的依赖。
- 采用改进的 DPO 目标函数,引入温度缩放的交叉熵损失,以平衡策略更新与参考模型的一致性。
- 结合人工参与与自动化过滤流程,确保训练所用的响应对具备高质量、多样性与现实感,且为幻觉-负样本对。
- 提出句子级幻觉比率(SHR)作为新基准,用于定量评估细粒度、独立于预定义类别的幻觉现象。
实验结果
研究问题
- RQ1通过将幻觉问题重构为偏好学习任务,而非生成或后处理任务,能否有效减少视觉语言模型中的幻觉?
- RQ2如何高效构建高质量、风格一致的正样本与负样本响应对,以在无需大规模人工标注数据的前提下训练偏好模型?
- RQ3与监督微调和后处理修正方法相比,HA-DPO 在极小规模训练数据下,其幻觉减少效果如何?
- RQ4通过 HA-DPO 减少幻觉是否能带来视觉语言模型在多模态推理与感知能力方面的可测量提升?
- RQ5所提出的句子级幻觉比率(SHR)指标在捕捉多样化图像描述中细粒度、全面的幻觉模式方面是否有效?
主要发现
- 在 SHR 基准测试中,HA-DPO 将 MiniGPT-4 的幻觉率降低了 3.0 个百分点,从 47.3% 下降至 44.4% 的幻觉句子比例。
- 经过 HA-DPO 微调后,MiniGPT-4 在 POPE 上的准确率从 51.13% 提升至 86.13%,绝对提升达 35.0 个百分点。
- LLaVA-1.5 在 HA-DPO 微调后于 POPE 基准上取得了新的 SOTA F1 得分 90.25%,优于其他当前最优方法。
- MiniGPT-4 的 MME 得分从 932.00 提升至 1326.46,相对提升 42.32%,表明其多模态通用能力显著增强。
- InstructBLIP 在 MME 上的感知得分(Perception score)经 HA-DPO 微调后提升了 71.32 分,表明在多种模型上均实现了稳定性能提升。
- HA-DPO 仅使用 2,000 张图像和 16,000 对响应,就在 POPE 和 MME 上均取得 SOTA 结果,远少于其他方法(如 LLaVA-RLHF 的 160K 或 LRV 的 400K)所需的数据量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。