[論文レビュー] IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding
本論文は Image-Biased Decoding (IBD) を導入する。これは画像バイアス予測器と標準モデルを比較する対比的デコーディング法で、LVLM の幻覚を低減し、最小限のパラメータ負荷で真実性を向上させる。
Despite achieving rapid developments and with widespread applications, Large Vision-Language Models (LVLMs) confront a serious challenge of being prone to generating hallucinations. An over-reliance on linguistic priors has been identified as a key factor leading to these hallucinations. In this paper, we propose to alleviate this problem by introducing a novel image-biased decoding (IBD) technique. Our method derives the next-token probability distribution by contrasting predictions from a conventional LVLM with those of an image-biased LVLM, thereby amplifying the correct information highly correlated with image content while mitigating the hallucinatory errors caused by excessive dependence on text. We further conduct a comprehensive statistical analysis to validate the reliability of our method, and design an adaptive adjustment strategy to achieve robust and flexible handling under varying conditions. Experimental results across multiple evaluation metrics verify that our method, despite not requiring additional training data and only with a minimal increase in model parameters, can significantly reduce hallucinations in LVLMs and enhance the truthfulness of the generated response.
研究の動機と目的
- 言語的事前知識への過度な依存に起因する LVLM の幻覚を動機づけ、対策する。
- モデルを再学習させずに画像コンテンツを強調するデコーディング時機の機構を開発する。
- 画像バイアス予測器と標準モデルをペアにした対照的デコーディングフレームワークを導入し、トークン選択を改善する。
- 最小限のオーバーヘッドで LVLM 全体の幻覚低減を示す統計的・実証的検証を提供する。
提案手法
- パラメータを変更せずに、QK アテンション計算におけるバイアス係数 c を介して画像トークンへの注意を増幅することで、画像バイアス LVLM hatTheta を構築する。
- 元のモデル theta と画像バイアスモデル hatTheta の予測を対比して次のトークン対数を計算し、L_CD = logit_hatTheta - logit_theta、softmax(L_CD) から p(y_i | y_<i) を導出する。
- theta から hatTheta への確率上昇が最も大きいトークンは、内容語には正解の可能性が高い(機能語ではない)と仮定する。
- 適応因子 I とスケーリングパラメータ alpha によって制御される、標準的な MLE デコーディングと CD ベースの調整を組み合わせる動的調整機構を導入し、異なる語種や theta と hatTheta の類似性を扱う。
- (a) 軽量なプロンプトチューニング(P) による COCO キャプションで hatTheta のファインチューニング、(b) 高確率トークンに候補を制限する適応的妥当性制約を追加して IBD を強化する。
- L_CD、動的重み付け、候補-ヘッド制約 V_head(y_<i) の式を含む完全な手法を提示する。
実験結果
リサーチクエスチョン
- RQ1画像バイアスデコードは、ベースラインデコード戦略と比較して LVLM の幻覚を低減するか?
- RQ2画像に焦点を当てた予測器から導かれる対照的デコードスコアは、機能語の過剰訂正を避けつつ内容語のトークン選択を改善できるか?
- RQ3動的調整とプロンプトが、IBD の堅牢性を LVLM およびデータセット全体でどう影響するか?
- RQ4画像バイアスがモデル世界知識とどのように相互作用するか、またこの手法に限界(例えば無害なテキストバイアスの幻覚など)はあるか?
主な発見
- IBD は CHAIR、GPT-4 支援、GPT-4V 支援の評価を通じて、ベースラインデコードや幻覚重視デコーダの複数を一貫して上回る。
- IBD は InstructBLIP、MiniGPT-4、LLaVA-1.5、Shikra のベースライン全般で CHAIR スコアを低く抑え(物体幻覚が少ない)。
- 約 74K の追加プロンプトパラメータ程度の最小限のオーバーヘッドで、IBD は ReCaption、Woodpecker、CD、VCD、DoLa、OPERA と比較して幻覚を減らし真実性を向上させる。
- 動的調整機構は、機能語にはMLEを優先し、内容語や高度に画像依存する予測にはCDを活用して堅牢性を高める。
- アブレーション研究は、性能維持のために動的調整、プロンプトの微調整、適応的妥当性制約が必要であることを示す。
- 複数の LVLM バックボーンで CHAIR、GPT-4 支援、GPT-4V 支援評価のトップまたはほぼトップのスコアを達成。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。