[論文レビュー] Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment
この論文では、データ拡張を用いた対照的チューニング手法であるHALVAを提案する。この手法は、データ拡張によって幻覚的な応答を生成し、トークンレベルでの対照的損失を適用することで、誤ったトークンが生成される可能性を低減する。このアプローチは、一般の視覚言語性能を損なわせることなく幻覚を効果的に低減し、最小限のファインチューニングと推論時のオーバーヘッドを必要としない。
Despite their significant advancements, Multimodal Large Language Models (MLLMs) often generate factually inaccurate information, referred to as hallucination. In this work, we address object hallucinations in MLLMs, where information is generated about an object not present in the input image. We introduce Data-augmented Phrase-level Alignment (DPA), a novel loss which can be applied to instruction-tuned off-the-shelf MLLMs to mitigate hallucinations, while preserving their general vision-language capabilities. To fine-tune MLLMs with DPA, we first generate a set of `hallucinated' and `correct' response pairs through generative data augmentation by selectively altering the ground-truth information of the correct responses at a phrase level. The DPA loss is then used to train MLLMs to reduce the likelihood of hallucinated phrases compared to the correct ones. Our thorough evaluation on various benchmarks confirms the effectiveness of DPA in mitigating hallucination while retaining the out-of-the-box performance of the MLLMs on general tasks. For instance, MLLMs finetuned with DPA, which we refer to as Hallucination Attenuated Language and Vision Assistant (HALVA), improve F1 by up to 13.4% on hallucination visual question-answering and reduce the hallucination rate by up to 4.2% on image description tasks.
研究の動機と目的
- モデルが存在しない物体や属性についての記述を生成する、MLLMにおける物体幻覚を是正すること。
- 推論時間の増加や再訓練を伴わずに幻覚を軽減する手法を開発すること。
- 幻覚軽減後も一般視覚言語性能を維持または向上させること。
- 大規模なデータやアーキテクチャの変更なしに、市販のMLLMに適用可能であること。
- 高コストの推論時補正や大規模な事前学習に依存しないこと。
提案手法
- 真実のキャプションの事実的属性を意図的に変更することで、幻覚的な応答を生成する生成的データ拡張を用いる。
- 事実的トークンと幻覚的トークンの間で、トークンレベルでの対照的損失を適用し、正しいトークンの相対的尤度を高める。
- ベースとなるMLLM(参照モデル)とのKLダイバージェンス制約を用いることで、チューニング中に一般能力を維持する。
- 事前学習済みMLLMに対して軽量なファインチューニングとして適用可能であり、市販モデルへの直接導入を可能にする。
- 幻覚低減と一般化能力の両面を評価するために、生成的および分類的視覚言語タスクで評価する。
- トレーニングプロセスは高速かつ効率的であり、最小限の計算リソースと追加の推論インfrastrucutureを必要としない。
実験結果
リサーチクエスチョン
- RQ1対照的チューニング手法は、一般視覚言語能力を損なわせることなくMLLMにおける物体幻覚を低減できるか?
- RQ2データ拡張による幻覚的応答生成は、推論時における幻覚検出の精度を向上させるか?
- RQ3ファインチューニング後、標準的な視覚言語ベンチマークでの性能が維持または向上するか?
- RQ4市販のMLLMに最小限の計算コストと推論オーバーヘッドで適用可能か?
- RQ5トレーニングデータ内の物体共起パターンに起因する幻覚は、どの程度軽減されるか?
主な発見
- HALVAは、生成的および分類的視覚言語ベンチマークにおいて、幻覚の発生を顕著に低減し、ベースライン手法を上回る幻覚低減効果を示した。
- VQAv2、GQA、OK-ViCaなどの標準的な視覚言語ベンチマークでも性能を維持または向上させたことから、一般能力に悪影響がないことが示された。
- 質的比較により、正の指示バイアスによってすべての質問に「はい」と答える傾向を示すMLLMの問題を、HALVAが効果的に是正した。
- 共起パターンに起因する幻覚(例:野球のシーンで「ピッチャー」に「バッター」や「ウムパイア」を誤って関連づける)も、成功裏に是正した。
- 対照的チューニングプロセスは効率的であり、最小限のトレーニング時間と追加の推論コストを要せず、本番環境への適用に適している。
- 質的結果から、HALVAは物体の位置や属性を正確に記述している一方で、ベースモデルのLLaVA-v1.5は「にんじん」や「人」、「ハンドバッグ」など、実際には存在しない物体を頻繁に幻覚的に生成していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。