Skip to main content
QUICK REVIEW

[論文レビュー] MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation

Chenxi Wang, Xiang Chen|arXiv (Cornell University)|Oct 15, 2024
Hallucinations in medical conditionsNeuroscience被引用数 3
ひとこと要約

この論文では、最終出力のログティを補正するために、以前の層からの知識を動的に選択・統合することで、 hallucinations を軽減するトレーニングフリーでモデルに依存しないデコーディング手法 DeCo を提案する。DeCo は、画像キャプションベンチマークにおいて平均で10.8%の hallucination 率削減を達成しながら、低レイテンシを維持し、VCD や OPERA などの先行手法を上回る性能を発揮する。

ABSTRACT

Multimodal Large Language Models (MLLMs) frequently exhibit hallucination phenomena, but the underlying reasons remain poorly understood. In this paper, we present an empirical analysis and find that, although MLLMs incorrectly generate the objects in the final output, they are actually able to recognize visual objects in the preceding layers. We speculate that this may be due to the strong knowledge priors of the language model suppressing the visual information, leading to hallucinations. Motivated by this, we propose a novel dynamic correction decoding method for MLLMs DeCo, which adaptively selects the appropriate preceding layers and proportionally integrates knowledge into the final layer to adjust the output logits. Note that DeCo is model agnostic and can be seamlessly incorporated with various classic decoding strategies and applied to different MLLMs. We evaluate DeCo on widely-used benchmarks, demonstrating that it can reduce hallucination rates by a large margin compared to baselines, highlighting its potential to mitigate hallucinations. Code is available at https://github.com/zjunlp/DeCo.

研究の動機と目的

  • MLLM が視覚的情報にアクセスしているにもかかわらず、存在しないオブジェクトを生成する理由を調査すること。
  • MLLM が視覚的コンテンツを本当に「見ている」のか、それとも生成過程で言語モデルの事前知識にだまされているのかを理解すること。
  • 微調整や複雑な後処理を必要とせず、トレーニングフリーでモデルに依存しないデコーディング手法を開発すること。
  • 応答品質を維持しつつ、推論レイテンシを最小限に抑えて hallucination の抑制を向上させること。

提案手法

  • DeCo は、MLLM の初期層では真のトークンに対して高い信頼度を示すが、深層部では言語モデルの事前知識によってその認識が抑制されることを特定する。
  • トークンの信頼度に基づいて、最も情報量の多い以前の層を動的に選択し、そのログティを最終層の出力に統合する。
  • 動的なソフトモジュレーション機構により、元の生成スタイルを保ちつつ、 hallucinated 出力を是正する。
  • この手法は、グリーディ検索、nucleus サンプリング、ビームサーチなどの標準的なデコーディング戦略と互換性がある。
  • 再訓練を必要としないため、任意の MLLM アーキテクチャに適用可能で、既存のパイプラインへの統合も容易である。
  • 外部ツールや追加の推論モジュールを用いずに、モデル内部の活性化状態を活用して最終予測を是正する。

実験結果

リサーチクエスチョン

  • RQ1MLLM は、後続層で hallucination を起こしても、初期層では視覚的オブジェクトを認識しているのか?
  • RQ2言語モデルの事前知識がデコーディング過程で視覚的情報をどの程度抑制しているのか? その結果、hallucinations が生じるのか?
  • RQ3再訓練を伴わずに、初期層の知識を動的に統合することで、hallucination の軽減を向上させられるか?
  • RQ4DeCo は、既存のデコーディングベースおよび後処理手法と比較して、hallucination 減少と推論効率の両面で優れているか?

主な発見

  • MLLM は初期層で視覚的オブジェクトを認識しており、真のトークンに対して高い信頼度を示すが、言語モデルの事前知識の影響により、深層部ではその認識が抑制される。
  • DeCo は、強力なベースラインと比較して、画像キャプションベンチマークで平均で10.8%の hallucination 率削減を達成する。
  • VCD や OPERA よりも hallucination の抑制性能が優れており、レイテンシは1.2倍にしか増加しない。これは、以前の手法と比較して顕著に低い水準である。
  • DeCo は POPE や MME といった VQA ベンチマークでも優れた性能を示し、タスクに広く適用可能であることが実証された。
  • 真実性の向上は見られたが、詳細度の指標にはわずかな負の影響が見られ、正確性と記述の豊かさの間にはトレードオフがあることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。