Skip to main content
QUICK REVIEW

[論文レビュー] VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models

Yuxuan Wang, Yueqian Wang|arXiv (Cornell University)|Jun 24, 2024
Schizophrenia research and treatment被引用数 4
ひとこと要約

本稿では、大規模な動画言語モデル(LVLM)における内在的および外在的ホワリケーションを評価するための包括的ベンチマークであるVideoHallucerを紹介する。敵対的二値動画QA設定を用い、基本的でホワリケーションを含む質問ペアを提示することで、現在のLVLMがホワリケーションに深刻な問題を抱えていることが明らかになった。特に外在的事実的ホワリケーションの検出においては、データ量やパラメータ数のスケーリングによる改善が限定的である。また、自己教師付きPEPフレームワーク(self-PEP)により、平均で5.38%のホワリケーション耐性向上が達成された。

ABSTRACT

Recent advancements in Multimodal Large Language Models (MLLMs) have extended their capabilities to video understanding. Yet, these models are often plagued by "hallucinations", where irrelevant or nonsensical content is generated, deviating from the actual video context. This work introduces VideoHallucer, the first comprehensive benchmark for hallucination detection in large video-language models (LVLMs). VideoHallucer categorizes hallucinations into two main types: intrinsic and extrinsic, offering further subcategories for detailed analysis, including object-relation, temporal, semantic detail, extrinsic factual, and extrinsic non-factual hallucinations. We adopt an adversarial binary VideoQA method for comprehensive evaluation, where pairs of basic and hallucinated questions are crafted strategically. By evaluating eleven LVLMs on VideoHallucer, we reveal that i) the majority of current models exhibit significant issues with hallucinations; ii) while scaling datasets and parameters improves models' ability to detect basic visual cues and counterfactuals, it provides limited benefit for detecting extrinsic factual hallucinations; iii) existing models are more adept at detecting facts than identifying hallucinations. As a byproduct, these analyses further instruct the development of our self-PEP framework, achieving an average of 5.38% improvement in hallucination resistance across all model architectures.

研究の動機と目的

  • 動画の行動や出来事といった動的なコンテンツに起因するホワリケーションの包括的評価の欠如に対処すること。
  • LVLMにおけるホワリケーションの明確な分類法を確立し、動画内容と矛盾する内在的ホワリケーションと、動画からは検証できない外在的ホワリケーションに区分けし、詳細な分析のためのサブカテゴリを設定すること。
  • 言語バイアスを最小限に抑えてホワリケーション検出の信頼性を高める、強固な敵対的二値動画QA評価フレームワークを構築すること。
  • 11種類の最先端LVLMのホワリケーション脆弱性を実証的に分析し、データ量やモデルパラメータのスケーリングの限界を特定すること。
  • ベンチマークの発見から得た知見を基に、自己教師付きPEPフレームワークのような改善された防御メカニズムの開発を支援すること。

提案手法

  • 二段階のホワリケーション分類法を提案:動画内容と矛盾する内在的ホワリケーションと、動画からは検証できない外在的ホワリケーション。さらに、オブジェクト関係、時間的、意味的詳細、外在的事実的、外在的非事実的の5つのサブタイプを含む。
  • 各動画に対して基本的質問とホワリケーションを含むバージョンの質問ペアを提示する敵対的二値動画QA評価プロトコルを設計し、『はい』と『いいえ』の回答がバランスされるようにすることで、言語バイアスを低減する。
  • 高品質な人間アノテーションによる質問ペアを構築し、説明のアノテーションを詳細に付与することで、評価時の誤解を軽減し、明確性を向上させる。
  • 二値分類の設定を採用し、モデルが基本的(正しく)な質問とホワリケーションを含む質問を区別できるかどうかを測定し、両方のタイプの精度を測定する。
  • 自己教師付きのデータ拡張および微調整手法であるself-PEPフレームワークを導入。敵対的例に対するモデルの予測から学習することで、ホワリケーション耐性を向上させる。
  • 標準化された指標とスケーリング効果に関するアブレーションスタディを用いて、11種類のLVLMを、内在的および外在的ホワリケーションの全カテゴリにわたって評価する。

実験結果

リサーチクエスチョン

  • RQ1動的な動画コンテンツを処理する際、現在の大規模な動画言語モデルはどの程度、内在的および外在的ホワリケーションを示しているか?
  • RQ2モデルサイズや学習データ量をスケーリングすることで、特に外在的事実的ホワリケーションの検出にどのような影響が生じるか?
  • RQ3なぜモデルは事実の認識には優れているが、ホワリケーションの検出には劣っているのか。その背後にある根本的原因は何か?
  • RQ4自己教師付きフレームワーク(self-PEP)は、多様なLVLMアーキテクチャにわたり、ホワリケーション耐性を効果的に向上させることができるか?
  • RQ5さまざまなホワリケーションサブタイプにおいて、人間の水準の性能とモデルの水準の性能は、どのように比較されるか?

主な発見

  • 現在の多数のLVLMは顕著なホワリケーション問題を示しており、VideoHallucerの全設定において、人間とモデルの間には大きな性能格差が存在する。
  • モデルパラメータ数や学習データ量のスケーリングは、基本的視覚的キューの検出や反事実的ホワリケーションの検出には効果的であるが、外在的事実的ホワリケーションの検出には限定的な利益しかもたらさない。
  • モデルは一貫して事実の認識には優れているが、ホワリケーションの検出には劣っており、これはその推論能力に根本的な非対称性があることを示唆している。
  • self-PEPフレームワークは、評価された全モデルアーキテクチャで平均5.38%のホワリケーション耐性向上を達成し、その有効性が裏付けられた。
  • Gemini-1.5-Proは外在的事実的ホワリケーションに対して64%の全体的な正確性を示したが、依然として人間レベルの性能には達していない。
  • LLaMA-VIDとVideoLaVITは基本的質問に対して高いベースライン性能(それぞれ98%および97.5%)を示したが、ホワリケーションを含む質問に対してはそれぞれ2.5%および6%の正確性にとどまり、ホワリケーションに対して極めて脆弱であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。