[論文レビュー] Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
本稿では、対照的学習における hallucinative なキャプションをハードネガティブ例として用いることで、マルチモーダル大規模言語モデル(MLLMs)における幻覚を低減する Hallucination Augmented Contrastive Learning(HACL)を提案する。視覚的表現を幻覚のないテキストと一致させ、幻覚のありそうなテキストから遠ざけることで、MMhal-Bench において MiniGPT-4 と比較して幻覚を 34.66% 減少させ、複数のベンチマークで性能向上を達成した。
Multi-modal large language models (MLLMs) have been shown to efficiently integrate natural language with visual information to handle multi-modal tasks. However, MLLMs still face a fundamental limitation of hallucinations, where they tend to generate erroneous or fabricated information. In this paper, we address hallucinations in MLLMs from a novel perspective of representation learning. We first analyzed the representation distribution of textual and visual tokens in MLLM, revealing two important findings: 1) there is a significant gap between textual and visual representations, indicating unsatisfactory cross-modal representation alignment; 2) representations of texts that contain and do not contain hallucinations are entangled, making it challenging to distinguish them. These two observations inspire us with a simple yet effective method to mitigate hallucinations. Specifically, we introduce contrastive learning into MLLMs and use text with hallucination as hard negative examples, naturally bringing representations of non-hallucinative text and visual samples closer while pushing way representations of non-hallucinating and hallucinative text. We evaluate our method quantitatively and qualitatively, showing its effectiveness in reducing hallucination occurrences and improving performance across multiple benchmarks. On the MMhal-Bench benchmark, our method obtains a 34.66% /29.5% improvement over the baseline MiniGPT-4/LLaVA. Our code is available on https://github.com/X-PLUG/mPLUG-HalOwl/tree/main/hacl.
研究の動機と目的
- マルチモーダル大規模言語モデル(MLLMs)において、事実と異なる、あるいは捏造された視覚的記述を生成するという、長年の幻覚問題に対処すること。
- LLM の表現空間におけるテキストおよび視覚的表現の分布を分析することで、幻覚の根本的原因を解明すること。
- 視覚的およびテキスト的モダリティ間のクロスモダリティ表現の整合性を向上させ、幻覚の検出および低減を促進すること。
- 幻覚のありそうなキャプションをハードネガティブ例として活用する対照的学習フレームワークを構築すること。
- MMhal-Bench や MME を含む複数のマルチモーダルベンチマークで、提案手法の有効性を検証すること。
提案手法
- 本手法は、投影された視覚的トークン系列と LLM からのテキスト的トークン系列との間で対照的学習を導入する。
- GPT-4 を用いて生成された幻覚のありそうなキャプションを、トレーニング中に正例キャプションと対比するハードネガティブ例として使用する。
- 対照的損失は、非幻覚的テキストと視覚的入力の表現を近づけ、非幻覚的および幻覚的テキストの表現を遠ざけるように適用される。
- 視覚エンコーダーと LLM 間の学習済みインターフェースは、この対照的目的関数を用いて微調整され、クロスモダリティの整合性が向上する。
- 本手法は事前学習段階で適用され、幻覚のありそうなキャプションの使用やトレーニングパラダイムの選択がもたらす影響を評価するためのアブレーションスタディが実施される。
- t-SNE を用いた表現空間の可視化により、HACL がモダリティギャップを低減し、幻覚のありそうなテキスト表現とそうでない表現を分離することを確認した。
実験結果
リサーチクエスチョン
- RQ1MLLM における幻覚の発生率が著しく高い要因は何か? また、幻覚のありそうなテキストとそうでないテキストの表現分布は、その要因にどのように寄与しているか?
- RQ2視覚的およびテキスト的表現間のクロスモダリティ的意味的ギャップが、MLLM における幻覚検出をどの程度妨げているか?
- RQ3幻覚のありそうなキャプションを対照的学習におけるハードネガティブ例として用いることで、整合性の向上と幻覚の低減が実際に可能になるか?
- RQ4事前学習段階において LLM や視覚エンコーダーを凍結するか、有効化するかというトレーニングパラダイムの選択が、HACL の性能と安定性に与える影響は何か?
- RQ5HACL は幻覚の低減に加え、標準ベンチマークにおける一般的なマルチモーダル推論性能の向上にも寄与するか?
主な発見
- MMhal-Bench ベンチマークにおいて、HACL は MiniGPT-4 ベースラインと比較して幻覚を 34.66% 減少させた。
- MME ベンチマークでは、HACL はベースラインの LLaVA と比較して性能を 11% 向上させた。
- t-SNE を用いた表現空間の可視化により、HACL が視覚的およびテキスト的表現間のモダリティギャップを顕著に低減していることが示された。
- HACL を適用した後、幻覚のありそうなキャプションの表現が、正例キャプションからより明確に分離されるようになった。これは、分離性の向上を示している。
- 対照的学習に幻覚のありそうなキャプションを含めることで、顕著な性能向上が得られたが、それらを省いた場合の改善は限定的であった。
- 最初の事前学習フェーズで LLM を有効化すると、深刻な忘却が発生し、性能が低下した。一方、視覚エンコーダーを有効化することで、整合性と性能が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。