[論文レビュー] PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
本稿では、大規模な視覚言語モデル(LVLM)における内在的視覚言語的錯覚(IVL-Hallu)を評価するための新規ベンチマークデータセットであるPhDを紹介する。本研究では、物体、属性、マルチモodalな矛盾、一般的常識に反する、4つの錯覚タイプの分類を提案し、自動プロンプト駆動のパイプラインを用いて高品質で多様な錯覚インスタンスを生成する。5つの最先端LVLMを用いた広範な実験から、すべての錯覚タイプにおいて顕著な性能低下が確認され、モデルがLLMの事前知識やモダリティの不均衡に起因する錯覚に対して脆弱であることが示された。
Multimodal Large Language Models (MLLMs) hallucinate, resulting in an emerging topic of visual hallucination evaluation (VHE). This paper contributes a ChatGPT-Prompted visual hallucination evaluation Dataset (PhD) for objective VHE at a large scale. The essence of VHE is to ask an MLLM questions about specific images to assess its susceptibility to hallucination. Depending on what to ask (objects, attributes, sentiment, etc.) and how the questions are asked, we structure PhD along two dimensions, i.e. task and mode. Five visual recognition tasks, ranging from low-level (object / attribute recognition) to middle-level (sentiment / position recognition and counting), are considered. Besides a normal visual QA mode, which we term PhD-base, PhD also asks questions with specious context (PhD-sec) or with incorrect context ({PhD-icc), or with AI-generated counter common sense images (PhD-ccs). We construct PhD by a ChatGPT-assisted semi-automated pipeline, encompassing four pivotal modules: task-specific hallucinatory item (hitem) selection, hitem-embedded question generation, specious / incorrect context generation, and counter-common-sense (CCS) image generation. With over 14k daily images, 750 CCS images and 102k VQA triplets in total, PhD reveals considerable variability in MLLMs' performance across various modes and tasks, offering valuable insights into the nature of hallucination. As such, PhD stands as a potent tool not only for VHE but may also play a significant role in the refinement of MLLMs.
研究の動機と目的
- 物体の錯覚を超える多様な内在的錯覚タイプに対する体系的な評価の欠如を解消すること。
- 物体、属性、マルチモダリティ的矛盾、一般的常識に反する、4つの明確に区別できる視覚言語的錯覚タイプの特定と分類すること。
- これらのカテゴリにわたる高品質で多様な錯覚データを生成するための自動的でプロンプト駆動のパイプラインの開発。
- 最先端のLVLMのこれらの錯覚タイプに対するロバストネスを評価し、失敗の根本的原因を解明すること。
- LLMの事前知識とモダリティの不均衡の役割を明らかにすることで、今後の錯覚軽減研究の基盤を提供すること。
提案手法
- その原因とLVLM出力への反映を根拠に、物体、属性、マルチモダリティ的矛盾、一般的常識に反する、4つの内在的錯覚タイプの分類を提唱する。
- 視覚的および言語的入力を操作することで特定の錯覚タイプを誘発するよう設計された、自動的でプロンプト駆動のデータ生成パイプラインを構築する。
- 識別が難しい物体-属性ペア(例:金属製のポット vs. 陶器製のポット)を用いて、物体および属性の錯覚データを高品質に生成する。
- 画像の内容と矛盾する質問を構築することでマルチモダリティ的矛盾の錯覚を生成し、Yes/No形式とオープンエンド形式の両方を用いてモデルのロバストネスをテストする。
- 一般的常識に反する画像(例:ネズミが猫よりも大きい)と、LLMベースの推論を引き起こすテキスト質問を組み合わせることで、一般的常識に反する錯覚を構築する。
- ゼロショットおよびフェイシュット設定を用いて、5つの最先端LVLM(例:LLaVA、Qwen-VL)をPhDベンチマークで評価し、錯覚発生率と性能低下を測定する。
実験結果
リサーチクエスチョン
- RQ1物体、属性、マルチモダリティ的矛盾、一般的常識に反する、4つの異なるタイプの内在的錯覚がLVLMにどのように現れるか。
- RQ2最先端のLVLMが、これらの4つのカテゴリにわたる錯覚をどれほど正しく検出・回避できないか。
- RQ3モダリティの不均衡とLLMの事前知識が、LVLMにおける錯覚生成にどのように寄与しているか。
- RQ4視覚的および言語的入力が矛盾する際、テキストプロンプトのトーンや表現が錯覚をどのように拡大させるか。
- RQ5自動的でプロンプト駆動のデータ生成は、LVLMのロバストネス評価のための多様で高品質な錯覚インスタンスを効果的に生成できるか。
主な発見
- LLaVAは、オープンエンド形式のマルチモダリティ的矛盾質問における性能が89.3%から10.9%に低下し、視覚的および言語的入力が矛盾する際、答えが不可能な質問を正しく検出できない深刻な失敗を示した。
- Qwen-VLはマルチモダリティ的矛盾質問に対してより高いロバストネスを示したが、これは標的的な adversarial 訓練によるものであり、モデルアーキテクチャと訓練法が錯覚を軽減できる可能性を示唆している。
- 属性の錯覚では、物体の錯覚よりも常に低いモデル性能が観察され、微細な属性理解がより困難で誤りを起こしやすいことが示された。
- 一般的常識に反する錯覚は強力な錯覚反応を引き起こし、LLMが一般的常識が破られる場合に画像の内容ではなく内部知識に依存する傾向があることを確認した。
- テキストのトーンの強さが錯覚発生率に顕著な影響を及ぼし、より強いテキスト的キューがモデルの言語への依存を増やし、画像との整合性を低下させた。
- 5つの最先端LVLMすべてが、4つのすべてのタイプで顕著な錯覚発生率を示し、モダリティの不均衡とLLMの事前知識に起因する根本的な脆弱性が明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。