[論文レビュー] HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
HallusionBenchは、346枚の画像にわたる1,129組の手作業で作成された視覚的質問ペアを含む、独創的な診断ベンチマークであり、大規模視覚言語モデル(LVLM)における言語的錯覚と視覚的錯覚を体系的に評価・分析することを目的としている。GPT-4Vでさえも31.42%の質問ペア正答率にとどまり、最先端モデルにおいて言語的事前知識への過剰依存と視覚的入力の誤解釈という深刻な失敗モードが露呈された。
We introduce HallusionBench, a comprehensive benchmark designed for the evaluation of image-context reasoning. This benchmark presents significant challenges to advanced large visual-language models (LVLMs), such as GPT-4V(Vision), Gemini Pro Vision, Claude 3, and LLaVA-1.5, by emphasizing nuanced understanding and interpretation of visual data. The benchmark comprises 346 images paired with 1129 questions, all meticulously crafted by human experts. We introduce a novel structure for these visual questions designed to establish control groups. This structure enables us to conduct a quantitative analysis of the models' response tendencies, logical consistency, and various failure modes. In our evaluation on HallusionBench, we benchmarked 15 different models, highlighting a 31.42% question-pair accuracy achieved by the state-of-the-art GPT-4V. Notably, all other evaluated models achieve accuracy below 16%. Moreover, our analysis not only highlights the observed failure modes, including language hallucination and visual illusion, but also deepens an understanding of these pitfalls. Our comprehensive case studies within HallusionBench shed light on the challenges of hallucination and illusion in LVLMs. Based on these insights, we suggest potential pathways for their future improvement. The benchmark and codebase can be accessed at https://github.com/tianyi-lab/HallusionBench.
研究の動機と目的
- 大規模視覚言語モデル(LVLM)の言語的錯覚と視覚的錯覚に関連する失敗モードを診断し、体系的に分析すること。
- 標準的な正答率指標を超えたモデル行動の定量的分析を可能にする診断ベンチマークの開発。
- LVLMが言語的事前知識に過剰に依存していること、および最先端モデルでさえも視覚的誤解釈に脆弱であることを暴露すること。
- 特定の失敗パターンを分離・研究できるように、制御された視覚的質問ペアを備えた構造的で人間がアノテートしたデータセットの提供。
- LVLM推論における具体的な失敗タイプとその根本的要因を同定することで、将来のモデル改善を支援すること。
提案手法
- 165枚のオリジナル画像と181枚の人が編集した画像を用いて、1,129組の視覚的質問・回答(VQA)ペアを、新しいペア質問構造で作成。
- 各VQAペアには、標準的な質問と、視覚的編集を加えた変更版の質問が含まれており、モデルの反応を異なる条件下で比較可能にしている。
- 元画像と編集済み画像の両条件における応答の一貫性に基づき、失敗モードを分類するための意思決定ツリー枠組みを適用。
- この手法により、言語的錯覚(視覚的入力が存在しない場合の誤った回答)と視覚的錯覚(視覚的編集の誤解による誤った回答)の定量的診断が可能になった。
- 制御群デザインを用いて、失敗が言語的事前知識由来か、視覚的誤認知由来かを隔離して評価。
- フレームワークにより、失敗を言語的錯覚、視覚的錯覚、あるいは両者の組み合わせによるものとして診断ラベル付け可能。
実験結果
リサーチクエスチョン
- RQ1GPT-4V や LLaVA-1.5 といった最先端のLVLMは、視覚的入力が存在しない、あるいは変更された場合に、どれほど言語的錯覚を示すか?
- RQ2画像の視覚的編集がLVLMの推論に与える影響は何か? そして、誤りの何パーセントが視覚的錯覚に起因するのか?
- RQ3構造的な診断フレームワークは、LVLMの応答において言語的錯覚と視覚的錯覚を区別できるか?
- RQ4複雑で曖昧な視覚的推論タスクにおいて、最先端のLVLMと人間レベルの理解との間には、どれほどの性能格差があるか?
- RQ5回転させたグラフを誤読する、地図の領域が入れ替わっているなど、具体的な失敗パターンは、現在のLVLMアーキテクチャの根本的弱みをどのように露呈するか?
主な発見
- 最先端のLVLMとされるGPT-4Vは、HallusionBenchにおいて質問ペア正答率がわずか31.42%にとどまり、顕著な推論制限が示された。
- 他の全評価対象モデルが16%未満の正答率にとどまり、LVLM全体にわたる顕著な性能格差と広範な失敗が確認された。
- 多数の失敗が言語的錯覚として診断され、視覚的入力が存在しない状況でも、パラメトリック知識に依存して誤った回答をした。
- 編集済みの地図や回転させたグラフを誤って読み取る視覚的錯覚が頻繁に観察され、視覚的入力が明確に変更されているにもかかわらず、その誤解が生じた。
- LLaVA-1.5は視覚的入力なしでは弱い常識的推論を示し、誤った視覚的編集が提示されても答えを是正できず、視覚的根拠の欠如が顕著に表れた。
- 意思決定ツリー分析により失敗モードが的確に分類され、誤りの30%が言語的錯覚、25%が視覚的錯覚、残り45%が両者の組み合わせによるものであることが判明した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。