Skip to main content
QUICK REVIEW

[논문 리뷰] VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models

Yuxuan Wang, Yueqian Wang|arXiv (Cornell University)|2024. 06. 24.
Schizophrenia research and treatment인용 수 4
한 줄 요약

이 논문은 대규모 비디오-언어 모델(LVLM)에서 내재적 및 외재적 환각 현상을 평가하기 위한 종합적인 벤치마크인 VideoHallucer를 소개한다. 기본 질문과 환각된 질문을 쌍으로 제공하는 적대적 이진 비디오 질의응답(VideoQA) 설정을 통해 현재의 LVLM이 특히 외재적 사실 환각을 탐지하는 데에서 광범위한 환각 문제를 겪고 있음을 드러내며, 데이터 및 파rameter의 확장이 이러한 경우에 한계가 있음을 보여준다. 또한 자가-PEP 프레임워크는 평균 5.38%의 환각 저항력 향상을 이룬다.

ABSTRACT

Recent advancements in Multimodal Large Language Models (MLLMs) have extended their capabilities to video understanding. Yet, these models are often plagued by "hallucinations", where irrelevant or nonsensical content is generated, deviating from the actual video context. This work introduces VideoHallucer, the first comprehensive benchmark for hallucination detection in large video-language models (LVLMs). VideoHallucer categorizes hallucinations into two main types: intrinsic and extrinsic, offering further subcategories for detailed analysis, including object-relation, temporal, semantic detail, extrinsic factual, and extrinsic non-factual hallucinations. We adopt an adversarial binary VideoQA method for comprehensive evaluation, where pairs of basic and hallucinated questions are crafted strategically. By evaluating eleven LVLMs on VideoHallucer, we reveal that i) the majority of current models exhibit significant issues with hallucinations; ii) while scaling datasets and parameters improves models' ability to detect basic visual cues and counterfactuals, it provides limited benefit for detecting extrinsic factual hallucinations; iii) existing models are more adept at detecting facts than identifying hallucinations. As a byproduct, these analyses further instruct the development of our self-PEP framework, achieving an average of 5.38% improvement in hallucination resistance across all model architectures.

연구 동기 및 목표

  • 동적인 콘텐츠(예: 행동 및 사건)에서 기인하는 환각 현상에 대한 종합적인 평가 부족 문제를 해결하기 위해.
  • LVLM에서의 환각 현상에 대한 명확한 분류 체계를 수립하여 내재적(비디오 콘텐츠와 모순됨)과 외재적(비디오에서 검증 불가능함) 유형을 구분하고, 세부 유형을 포함하여 분석을 가능하게 하기 위해.
  • 언어 편향을 최소화하고 환각 탐지 신뢰도를 향상시키기 위해, 언어 편향을 줄이는 데 초점을 맞춘 강력한 적대적 이진 비디오 질의응답 평가 프로토콜을 개발하기 위해.
  • 11개의 최신 LVLM의 환각 취약성을 실증적으로 분석하고, 데이터 및 모델 파라미터 확장을 통한 성능 향상의 한계를 규명하기 위해.
  • 벤치마크의 발견에서 유래한 통찰을 바탕으로 자가-PEP 프레임워크와 같은 향후 방어 기법의 개발을 이끌기 위해.

제안 방법

  • 내재적 환각(비디오와 일치하지 않음)과 외재적 환각(비디오에서 검증 불가능함)으로 구성된 이중 계층 환각 분류 체계를 제안하며, 오브제크트-관계, 시간적, 의미적 세부 정보, 외재적 사실, 외재적 비사실 등 5개의 하위유형 포함.
  • 각 비디오에 기본 질문과 환각된 질문을 쌍으로 제공하는 적대적 이진 비디오 질의응답 평가 프로토콜을 설계하여, 언어 편향을 줄이기 위해 '예'와 '아니요' 응답이 균형을 이루도록 함.
  • 명확성 향상과 오해를 줄이기 위해 인간이 검수한 고품질 질문 쌍과 상세한 설명 애너테이션을 구축.
  • 이진 분류 설정을 활용하여 모델이 기본 질문(정확함)과 환각된 질문을 구분하도록 하며, 양쪽 모두의 정확도를 측정.
  • 적대적 예시에 대한 모델 예측에서 학습하는 자가-감독 데이터 증강 및 미세조정 방법인 자가-PEP 프레임워크를 도입.
  • 표준화된 지표와 스케일링 효과에 대한 분석 실험을 통해 11개의 LVLM을 VideoHallucer의 모든 범주(내재적 및 외재적 환각 포함)에서 평가.

실험 결과

연구 질문

  • RQ1동적인 비디오 콘텐츠를 추론할 때 현재의 대규모 비디오-언어 모델은 내재적 및 외재적 환각을 어느 정도 겪고 있는가?
  • RQ2모델 크기와 학습 데이터의 확장을 통해 다양한 환각 유형, 특히 외재적 사실 환각의 탐지 능력에 어떤 영향을 미치는가?
  • RQ3왜 모델들은 사실을 인식하는 데는 더 잘하지만 환각을 탐지하는 데는 떨어지는가? 이러한 격차의 근본 원인은 무엇인가?
  • RQ4자기-감독 프레임워크인 자가-PEP는 다양한 LVLM 아키텍처에서 환각 저항력을 효과적으로 향상시킬 수 있는가?
  • RQ5다양한 환각 하위유형에서 인간 수준의 성능와 모델 수준의 성능는 어떻게 비교되는가?

주요 결과

  • 현재 대부분의 LVLM이 상당한 환각 문제를 겪고 있으며, VideoHallucer의 모든 설정에서 인간과 모델 간의 성능 격차가 뚜렷하다.
  • 모델 파rameter와 학습 데이터의 확장을 통해 기본 시각적 신호와 반사적 환각의 탐지 능력은 향상되지만, 외재적 사실 환각의 탐지에는 제한된 도움을 제공한다.
  • 모델들은 사실을 인식하는 데는 더 뛰어나지만 환각을 탐지하는 데는 떨어지며, 이는 이들의 추론 능력에 근본적인 비대칭성을 드러낸다.
  • 자기-PEP 프레임워크는 평가된 모든 모델 아키텍처에서 평균 5.38%의 환각 저항력 향상을 달성하여 효과성을 입증한다.
  • Gemini-1.5-Pro는 외재적 사실 환각 질문에서 가장 높은 전체 정확도(64%)를 기록했지만, 여전히 인간 수준의 성능에 못 미친다.
  • LLaMA-VID와 VideoLaVIT는 기본 질문에서 뛰어난 기초 성능(각각 98% 및 97.5%)을 보였지만, 환각된 질문에서는 각각 2.5% 및 6%의 정확도에 머물러 있어 환각에 매우 취약함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.