[論文レビュー] EventHallusion: Diagnosing Event Hallucinations in Video LLMs
この論文では、モデルの事前知識に起因するイベントハロシネーションを診断するための新しいベンチマークであるEventHallusionを紹介し、推論時に元の動画と時間的順序が乱れた動画入力を対比することで推論を改善する軽量な手法である時系列対比デコード(TCD)を提案する。TCDは、特にレアまたは誤解を招くイベントのシナリオにおいて、オープンソースのVideoLLMにおけるハロシネーションを顕著に低減するが、クローズドソースモデルは本質的により高い耐性を示す。
Recently, Multimodal Large Language Models (MLLMs) have made significant progress in the video comprehension field. Despite remarkable content reasoning and instruction following capabilities they demonstrated, the hallucination problem of these VideoLLMs is less explored compared with its counterpart in the image domain. To mitigate this gap, we propose EventHallusion, a novel benchmark that focuses on assessing the VideoLLMs' hallucination toward event, the crux of video analysis. From a hallucination attribution perspective, our EventHallusion benchmark is curated to assess a VideoLLM's susceptibility toward language priors and vision-language biases. On the other hand, we also propose a simple yet effective method, called Temporal Contrastive Decoding (TCD), to tackle the hallucination problems of VideoLLMs. The proposed TCD method rectifies the model's bias toward its priors during the decoding stage by comparing the original video with a modified version, in which temporal cues are disrupted. Through comprehensive evaluation of eight open-source and two closed-source VideoLLMs on the proposed EventHallusion benchmark, we observe that the open-source models suffer significantly from hallucination problems, whereas the closed-source ones perform markedly better. By further equipping open-source VideoLLMs with the proposed TCD approach, evident performance improvements are achieved across most metrics in the EventHallusion benchmark. Our codes and benchmark data are available at https://github.com/Stevetich/EventHallusion.
研究の動機と目的
- 動画言語モデル(Video LLM)におけるイベントハロシネーションの系統的評価の欠如、特に言語的・視覚的事前知識に起因するものに対処すること。
- 静的画像や時間的順序のハロシネーションではなく、動的動画イベントにおけるハロシネーションに特化したベンチマークの開発。
- オープンソースのVideoLLMがクローズドソースモデルよりもイベントハロシネーションに脆弱である理由の解明。
- 微調整を必要とせず、即座に適用可能なハロシネーション低減手法の提案。
- 提案手法の有効性を、多様なVideoLLMアーキテクチャおよびイベントタイプにわたり評価すること。
提案手法
- EventHallusionは、珍しいまたは直感に反するイベントを含む動画を手動で収集し、たとえば人が自転車を運んでいるときに『自転車に乗っている』と仮定するような、モデルの事前知識を引き出す質問をアノテートすることで構築される。
- ベンチマークは『完全なレアイベント』、『共通-レアが交互に現れるイベント』、『誤解を招く質問』の3つのカテゴリに分けられ、異なるハロシネーションのトリガーを検査する。
- 時系列対比デコード(TCD)は、元の動画と時間的順序がシャッフルされて整合性が損なわれたバージョンの両方に対するモデル出力を比較する。
- 自己回帰的デコード中に、TCDは両入力に対して一貫した予測を生成するよう促す対比損失を用いることで、誤った事前知識への依存を低減する。
- ハイパーパrameter α=1 および β=0.1 を用いて、元の入力と歪んだ入力のログティトを重み付きで組み合わせ、デコードプロセスの安定化を図る。
- TCDは、微調整やアーキテクチャ変更を必要としない、軽量な推論時手法として適用される。
実験結果
リサーチクエスチョン
- RQ1レアまたは直感に反する動画イベントに直面した際、既存のVideoLLMはイベントハロシネーションに対してどの程度の性能を示すか?
- RQ2イベント理解において、オープンソースのVideoLLMはクローズドソースモデルと比べてどの程度ハロシネーションに脆弱であるか?
- RQ3TCDのようなシンプルで微調整を伴わない手法が、多様なVideoLLMアーキテクチャにわたり、イベントハロシネーションを効果的に低減できるか?
- RQ4歪んだ動画でサンプリングされるフレーム数がTCDの性能に与える影響はどの程度か?
- RQ5なぜモデルは完全にレアなイベントよりも、共通-レアが交互に現れるイベントに対してより困難を感じるのか?
主な発見
- オープンソースのVideoLLMはEventHallusionにおいて深刻なハロシネーション問題を示し、特に『Interleaved』および『Misleading』カテゴリで、明確な手がかりがない場合に精度が著しく低下する。
- クローズドソースのVideoLLMは顕著に優れた耐性を示し、全カテゴリで高い精度を維持しており、事前知識に基づく誤りに対して本質的に強い抵抗性を示している。
- TCDは、LLaVA-NeXT-Video、VideoChat2、Vilaの3つのテスト済みVideoLLMバックボーンすべてで一貫した顕著な改善を達成し、特に『Interleaved』および『Misleading』ケースで顕著である。
- 歪んだ動画に4フレーム未満のフレームを使用するとTCDの性能が低下するため、過度な時間的破壊は対比信号を損なうことが示された。
- 『完全なレアイベント』ではTCDの改善が最小限にとどまるため、文脈的手がかりの欠如と強い事前知識の影響により、このようなシナリオは依然として困難であることが示唆された。
- 2値分類タスクにおいて、TCDはLLaVA-NeXT-Videoで全体の精度を最大15.6%向上させ、ハロシネーション予測の低減における有効性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。