[论文解读] RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
RLHF-V 通过使用密集的直接偏好优化(DDPO)方法,将模型行为与人类在幻觉问题上的细粒度、分段级修正对齐,从而提升多模态大语言模型(MLLM)的可信度。仅使用 1.4k 个标注样本,其幻觉率降低了 34.8%,优于使用 10k 个样本训练的 LLaVA-RLHF,且在对抗过度泛化引发的幻觉方面表现优于 GPT-4V。
Multimodal Large Language Models (MLLMs) have recently demonstrated impressive capabilities in multimodal understanding, reasoning, and interaction. However, existing MLLMs prevalently suffer from serious hallucination problems, generating text that is not factually grounded in associated images. The problem makes existing MLLMs untrustworthy and thus impractical in real-world (especially high-stakes) applications. To address the challenge, we present RLHF-V, which enhances MLLM trustworthiness via behavior alignment from fine-grained correctional human feedback. Specifically, RLHF-V collects human preference in the form of segment-level corrections on hallucinations, and performs dense direct preference optimization over the human feedback. Comprehensive experiments on five benchmarks in both automatic and human evaluation show that, RLHF-V can enable substantially more trustworthy MLLM behaviors with promising data and computation efficiency. Remarkably, using 1.4k annotated data samples, RLHF-V significantly reduces the hallucination rate of the base MLLM by 34.8%, outperforming the concurrent LLaVA-RLHF trained on 10k annotated data. The final model achieves state-of-the-art performance in trustworthiness among open-source MLLMs, and shows better robustness than GPT-4V in preventing hallucinations aroused from over-generalization. We open-source our code, model, and data at https://github.com/RLHF-V/RLHF-V.
研究动机与目标
- 解决多模态大语言模型(MLLM)中幻觉问题这一关键挑战,该问题在高风险现实应用场景中严重损害可信度。
- 克服现有强化学习人类反馈(RLHF)与指令微调方法的局限性,这些方法因反馈粒度过粗和标签模糊,难以精确对齐模型行为与人类偏好。
- 通过收集密集的、分段级的修正反馈而非对完整响应进行排序,提升学习效率并减少奖励欺骗(reward hacking)现象。
- 开发一种数据高效、鲁棒的训练框架,实现在最小人工标注成本下实现强行为对齐。
- 在保持强大帮助性与事实准确性的前提下,实现开源 MLLM 的最先进可信度水平。
提出的方法
- 收集人类反馈,形式为对模型输出中幻觉内容的细粒度、分段级修正,直接识别并纠正错误的视觉描述。
- 设计一种新型训练目标——密集直接偏好优化(DDPO),作为传统 RLHF 的监督替代方案,直接基于密集的细粒度偏好信号优化策略模型。
- 应用 DDPO 将 MLLM 策略与修正段落对齐,为幻觉区域分配更强的梯度信号,以提升事实准确性。
- 使用基于修正反馈训练的奖励模型引导策略更新,确保在优化过程中优先考虑修正内容。
- 将反馈收集与训练流程整合为统一框架,支持 MLLM 的高效、可扩展微调。
- 利用高质量、密集的反馈,即使在数据量极少的情况下也能实现有效的行为对齐,降低对大规模偏好标注的依赖。
实验结果
研究问题
- RQ1细粒度、分段级的人类反馈是否比粗粒度排序反馈更有效地提升 MLLM 的准确性和可信度?
- RQ2与基于传统 PPO 的 RLHF 相比,密集直接偏好优化(DDPO)是否能在 MLLM 对齐任务中实现更高效、更稳定的训练?
- RQ3在小规模人类反馈数据集(如 1.4k 个样本)下,是否能实现比以往工作(如 LLaVA-RLHF 使用 10k 个样本)更好的幻觉减少效果?
- RQ4与 GPT-4V 等强模型相比,RLHF-V 在应对由过度泛化引发的幻觉方面,其鲁棒性提升程度如何?
- RQ5所提出的框架是否可推广至其他非多模态场景下的 LLM,以减少其幻觉现象?
主要发现
- 仅使用 1.4k 个标注的修正反馈样本,RLHF-V 将基础 MLLM 的物体幻觉率降低 34.8%,显著优于需 10k 个样本才能达到类似效果的 LLaVA-RLHF。
- RLHF-V 在开源 MLLM 中实现了最先进水平的可信度,尤其在长文本、复杂响应中的事实准确性方面表现卓越。
- 在防止由过度泛化引发的幻觉方面,RLHF-V 的鲁棒性优于 GPT-4V,尤其在模糊或复杂的视觉场景中表现更优。
- 人工评估证实,RLHF-V 生成的响应在事实准确性方面更优,且比基础模型及竞争性微调模型更少出现幻觉。
- DDPO 能够在密集反馈下实现高效、稳定的训练,避免奖励欺骗,并更精准地分配信用至正确行为。
- 该框架在显著降低幻觉率的同时,仍保持强大的帮助性与响应质量,表明在事实准确性与实用性之间实现了有效平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。