Skip to main content
QUICK REVIEW

[논문 리뷰] EventHallusion: Diagnosing Event Hallucinations in Video LLMs

Jiacheng Zhang, Yang Jiao|arXiv (Cornell University)|2024. 09. 25.
Physical Unclonable Functions (PUFs) and Hardware Security인용 수 4
한 줄 요약

이 논문은 모델 사전 지식에 의해 유발되는 영상 LLM에서의 사건 환각 현상을 진단하기 위한 새로운 벤치마크인 EventHallusion을 소개하고, 복구된 영상 입력과 시간적으로 뒤섞인 입력을 대조함으로써 추론을 향상시키는 경량 방법인 시간대비 디코딩(TCD)을 제안한다. TCD는 특히 드문 또는 오해의 소지가 있는 사례에서 오픈소스 영상LLM에서 환각 현상을 크게 줄이며, 폐쇄소스 모델은 본질적으로 더 강한 저항성을 보인다.

ABSTRACT

Recently, Multimodal Large Language Models (MLLMs) have made significant progress in the video comprehension field. Despite remarkable content reasoning and instruction following capabilities they demonstrated, the hallucination problem of these VideoLLMs is less explored compared with its counterpart in the image domain. To mitigate this gap, we propose EventHallusion, a novel benchmark that focuses on assessing the VideoLLMs' hallucination toward event, the crux of video analysis. From a hallucination attribution perspective, our EventHallusion benchmark is curated to assess a VideoLLM's susceptibility toward language priors and vision-language biases. On the other hand, we also propose a simple yet effective method, called Temporal Contrastive Decoding (TCD), to tackle the hallucination problems of VideoLLMs. The proposed TCD method rectifies the model's bias toward its priors during the decoding stage by comparing the original video with a modified version, in which temporal cues are disrupted. Through comprehensive evaluation of eight open-source and two closed-source VideoLLMs on the proposed EventHallusion benchmark, we observe that the open-source models suffer significantly from hallucination problems, whereas the closed-source ones perform markedly better. By further equipping open-source VideoLLMs with the proposed TCD approach, evident performance improvements are achieved across most metrics in the EventHallusion benchmark. Our codes and benchmark data are available at https://github.com/Stevetich/EventHallusion.

연구 동기 및 목표

  • 영상 LLM에서의 사전 지식에 기인한 사전 지식 기반 환각 현상에 대한 체계적 평가 부족 문제를 해결하기 위해.
  • 정적 이미지나 시간 순서 환각이 아닌, 동적인 영상 내 사고의 환각에 특화된 벤치마크를 개발하기 위해.
  • 오픈소스 영상LLM이 폐쇄소스 모델보다 사전 지식 기반 환각에 더 취약한 이유를 규명하기 위해.
  • 微조정 없이도 환각 현상을 완화할 수 있는 즉시 적용 가능한 방법을 제안하기 위해.
  • 제안된 방법의 효과성을 다양한 영상LLM 아키텍처와 사고 유형에 걸쳐 평가하기 위해.

제안 방법

  • EventHallusion은 드문 또는 직관에 어긋나는 사고를 포함하는 영상을 수동으로 수집하고, '사람이 자전거를 메고 있다면 '타고 있다'고 가정하는' 등의 모델 사전 지식을 유도하는 질문을 주석으로 추가하여 구성된다.
  • 벤치마크는 '전체 드문 사고', '혼합된 일반-드문 사고', '오해의 소지가 있는 질문'의 세 가지 카테고리로 나뉘어, 다양한 환각 유도 요인을 시험한다.
  • 시간대비 디코딩(TCD)은 원본 영상과 시간적 순서가 뒤섞인 버전(프레임 순서를 뒤섞음)에 대해 모델의 출력을 비교한다.
  • 자기연쇄 디코딩 과정에서 TCD는 두 입력에 대해 일관된 예측을 생성하도록 유도하는 대비 손실을 사용하여, 부정확한 사전 지식에 대한 의존도를 줄인다.
  • 모델의 출력은 원본 및 왜곡된 입력의 로짓을 가중합으로 조합하며, 초모수 α=1 및 β=0.1을 사용하여 디코딩 과정의 안정성을 높인다.
  • TCD는 모델 미세조정이나 아키텍처 변경 없이도 경량의 추론 시점 방법으로 적용된다.

실험 결과

연구 질문

  • RQ1기존 영상LLM은 드문 또는 직관에 어긋나는 영상 사고에 직면했을 때 사고 환각에 대해 어떻게 성능을 보일까?
  • RQ2오픈소스 영상LLM은 사고 이해 능력에서 폐쇄소스 모델에 비해 얼마나 환각에 취약한가?
  • RQ3LLaVA-NeXT-Video, VideoChat2, Vila와 같은 다양한 영상LLM 아키텍처에서 TCD와 같은 단순한, 미세조정이 없는 방법이 사고 환각을 효과적으로 줄일 수 있는가?
  • RQ4왜곡된 영상에서 샘플링된 프레임 수가 TCD의 성능에 어떤 영향을 미치는가?
  • RQ5왜 모델은 완전히 드문 사고보다 혼합된 일반-드문 사고에서 더 어려움을 겪는가?

주요 결과

  • 오픈소스 영상LLM은 EventHallusion에서 특히 '혼합된' 및 '오해의 소지가 있는' 카테고리에서 심각한 환각 문제를 보이며, 명시적 단서가 없을 경우 정확도가 크게 떨어진다.
  • 폐쇄소스 영상LLM은 모든 카테고리에서 높은 정확도를 유지하며 뚜렷한 강건성을 보이며, 사전 지식 기반 오류에 대한 내재된 저항력이 뛰어나다는 것을 시사한다.
  • TCD는 테스트된 세 가지 영상LLM 기반 아키텍처(LaVA-NeXT-Video, VideoChat2, Vila) 전반에서 일관되고 뚜렷한 성능 향상을 이뤘으며, 특히 '혼합된' 및 '오해의 소지가 있는' 케이스에서 두드러진다.
  • 왜곡된 영상에서 4프레임 이하로 프레임 수를 줄이면 TCD의 성능이 저하되며, 이는 과도한 시간적 뒤섞임이 대비 신호를 해칠 수 있음을 시사한다.
  • TCD는 '전체 드문 사고' 케이스에서 최소한의 향상만을 보이며, 이는 맥락적 단서 부족과 강력한 사전 지식으로 인해 여전히 도전적인 문제임을 시사한다.
  • 이진 분류 작업에서 TCD는 LLaVA-NeXT-Video에서 전체 정확도를 최대 15.6% 향상시켜 환각적 사고 예측 감소의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.