Skip to main content
QUICK REVIEW

[論文レビュー] RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback

Tianyu Yu, Yuan Yao|arXiv (Cornell University)|Dec 1, 2023
Topic Modeling被引用数 5
ひとこと要約

RLHF-V は、 hallucination に関する詳細なセグメントレベルの人的補正と、密度の高い直接的好み最適化(DDPO)を用いて、モデルの行動を人間の好みに正確に合わせることで、マルチモーダル LLM の信頼性を向上させる。わずか 1.4k のアノテート済みサンプルで、 hallucination 率を 34.8% 減少させ、10k のサンプルでトレーニングされた LLaVA-RLHF を上回り、過剰一般化に起因する hallucination に対して GPT-4V よりも優れた耐性を示す。

ABSTRACT

Multimodal Large Language Models (MLLMs) have recently demonstrated impressive capabilities in multimodal understanding, reasoning, and interaction. However, existing MLLMs prevalently suffer from serious hallucination problems, generating text that is not factually grounded in associated images. The problem makes existing MLLMs untrustworthy and thus impractical in real-world (especially high-stakes) applications. To address the challenge, we present RLHF-V, which enhances MLLM trustworthiness via behavior alignment from fine-grained correctional human feedback. Specifically, RLHF-V collects human preference in the form of segment-level corrections on hallucinations, and performs dense direct preference optimization over the human feedback. Comprehensive experiments on five benchmarks in both automatic and human evaluation show that, RLHF-V can enable substantially more trustworthy MLLM behaviors with promising data and computation efficiency. Remarkably, using 1.4k annotated data samples, RLHF-V significantly reduces the hallucination rate of the base MLLM by 34.8%, outperforming the concurrent LLaVA-RLHF trained on 10k annotated data. The final model achieves state-of-the-art performance in trustworthiness among open-source MLLMs, and shows better robustness than GPT-4V in preventing hallucinations aroused from over-generalization. We open-source our code, model, and data at https://github.com/RLHF-V/RLHF-V.

研究の動機と目的

  • マルチモーダル LLM(MLLM)における hallucination の深刻な問題に取り組み、信頼性を損なう高リスクの実世界応用分野での信頼性を確保すること。
  • 粗い粒度のフィードバックと曖昧なラベル付けによる制限を克服し、モデル行動を人間の好みに正確に一致させる。
  • 人間の注釈の収集を段階的・セグメントレベルの補正フィードバックにすることで、学習効率を向上させ、報酬の悪用(reward hacking)を低減する。
  • 最小限の人的注釈作業で強力な行動整合性を実現する、データ効率的で耐性のあるトレーニングフレームワークを構築する。
  • オープンソースの MLLM において最先端の信頼性を達成するとともに、強力な役立性と事実に基づいた出力の維持を図る。

提案手法

  • モデル出力内の hallucinated コンtent に対して、細分化されたセグメントレベルの補正フィードバックとして人的フィードバックを収集し、誤った視覚的記述を直接特定・修正する。
  • 従来の RLHF とは異なり、政策モデルを直接細分化された好み信号に最適化する、新しいトレーニング目的である Dense Direct Preference Optimization(DDPO)を設計する。
  • DDPO を用いて MLLM の政策を補正済みセグメントに一致させ、 hallucination 発生領域に対して強い勾配信号を割り当て、事実に基づいた出力を向上させる。
  • 補正フィードバックを学習した報酬モデルを用いて、最適化中に補正を優先するように政策の更新をガイドする。
  • フィードバック収集とトレーニングパイプラインを統合したフレームワークを構築し、MLLM の効率的かつスケーラブルなファインチューニングを可能にする。
  • 高品質で密度の高いフィードバックを活用することで、大規模な好みのアノテーションに依存することなく、効果的な行動整合性を実現する。

実験結果

リサーチクエスチョン

  • RQ1細分化されたセグメントレベルの人的フィードバックは、粗い粒度の順位付けフィードバックに比べ、MLLM の正確性と信頼性をより効果的に向上させることができるか?
  • RQ2密度の高い直接的好み最適化(DDPO)は、MLLM の整合性にあたって、従来の PPO を用いた RLHF と比較して、より効率的かつ安定したトレーニングを可能にするか?
  • RQ3例えば 1.4k のサンプルという小規模な人的フィードバックデータセットが、先行研究で用いられた大規模データセット(例:LLaVA-RLHF の 10k)を上回る hallucination 減少を達成できるか?
  • RQ4GPT-4V や強力なモデルと比較して、RLHF-V は過剰一般化に起因する hallucination に対してどれほど耐性を示すか?
  • RQ5提案されたフレームワークは、マルチモーダル環境を超えたその他の LLM においても、hallucination の低減に一般化可能か?

主な発見

  • わずか 1.4k のアノテート済み補正フィードバックサンプルを用いて、ベースの MLLM のオブジェクト hallucination 率を 34.8% 減少させ、10k のサンプルを必要とした LLaVA-RLHF より顕著に優れた性能を示した。
  • RLHF-V は、オープンソースの MLLM において最先端の信頼性を達成し、長時間で複雑な出力において優れた事実に基づいた出力を示した。
  • 特に曖昧または複雑な視覚的状況において、過剰一般化に起因する hallucination を防ぐ点で、GPT-4V よりも優れた耐性を示した。
  • 人的評価により、RLHF-V が生成する出力は、ベースモデルや競合するファインチューニング済みモデルの出力よりも事実に基づいており、hallucination の発生が少ないことが確認された。
  • DDPO は、密度の高いフィードバックを用いて、報酬の悪用を回避し、正しい行動に適切な責任割り当てを行うことで、効率的で安定したトレーニングを可能にした。
  • hallucination の低減を顕著に実現しながらも、強い役立性と出力品質を維持しており、事実の正確性と実用性の間の効果的なトレードオフが図られていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。