Skip to main content
QUICK REVIEW

[논문 리뷰] Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models

Munan Ning, Bin Zhu|arXiv (Cornell University)|2023. 11. 27.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 영상 기반 대규모 언어 모델(Video-LLM)을 세 가지 수준에서 평가하기 위한 종합적 벤치마크 및 툴킷인 Video-Bench를 소개한다: 영상 전용 이해, 이전 지식 기반 질문 응답, 이해/결정 과제. 8개의 모델을 평가한 결과, 인간 수준의 이해, 특히 추론 및 이전 지식 통합 능력에서 뚜렷한 한계를 보이며 현재의 능력에 있어 핵심적 격차가 있음을 드러내고 향후 연구를 이끌어내는 데 기여한다.

ABSTRACT

Video-based large language models (Video-LLMs) have been recently introduced, targeting both fundamental improvements in perception and comprehension, and a diverse range of user inquiries. In pursuit of the ultimate goal of achieving artificial general intelligence, a truly intelligent Video-LLM model should not only see and understand the surroundings, but also possess human-level commonsense, and make well-informed decisions for the users. To guide the development of such a model, the establishment of a robust and comprehensive evaluation system becomes crucial. To this end, this paper proposes extit{Video-Bench}, a new comprehensive benchmark along with a toolkit specifically designed for evaluating Video-LLMs. The benchmark comprises 10 meticulously crafted tasks, evaluating the capabilities of Video-LLMs across three distinct levels: Video-exclusive Understanding, Prior Knowledge-based Question-Answering, and Comprehension and Decision-making. In addition, we introduce an automatic toolkit tailored to process model outputs for various tasks, facilitating the calculation of metrics and generating convenient final scores. We evaluate 8 representative Video-LLMs using extit{Video-Bench}. The findings reveal that current Video-LLMs still fall considerably short of achieving human-like comprehension and analysis of real-world videos, offering valuable insights for future research directions. The benchmark and toolkit are available at: \url{https://github.com/PKU-YuanGroup/Video-Bench}.

연구 동기 및 목표

  • 기본적인 영상 인식을 넘어서 다수준 이해를 포괄하는 통합적이고 종합적인 Video-LLM 평가 프레임워크의 부재를 해결하기 위해.
  • 공동체적 추론, 이전 지식 통합, 장기 시퀀스 이해 등 현재 Video-LLM 능력에서의 핵심 격차를 특정하기 위해.
  • 확률 매핑과 LLM 기반 의미 평가를 활용해 모델 출력을 효율적이고 정확하게 평가할 수 있도록 자동화된 평가 툴킷을 개발하기 위해.
  • 모델 아키텍처, 훈련 데이터 크기, 모듈 설계가 Video-LLM 성능에 미치는 영향에 대한 실증적 통찰을 제공함으로써 향후 연구를 이끌기 위해.

제안 방법

  • 영상 전용 이해(예: 요약, 이질성 탐지), 이전 지식 기반 질의응답(예: NBA, 음악 영상), 이해/결정 과제(예: 3차원 장면 이해, 자율주행)를 포함한 세 평가 수준에서 10개의 과제를 포함한 벤치마크 설계.
  • 모델이 생성한 텍스트 출력을 정답에 매핑하기 위해 확률 기반 선택과 LLM 기반 의미 유사도를 활용해 메트릭 계산을 수행하는 자동화된 평가 툴킷 구현.
  • 확률 기반, T5 기반, GPT 기반 메트릭을 다수 사용해 출력 정확도 평가. 특히 개방형 및 길이가 변동되는 출력에 대해 GPT 기반 메트릭이 뛰어난 신뢰성을 보였다.
  • 8개의 오픈소스 Video-LLM 간 비교 분석을 수행하여, 시각적 인코더, 시간적 모듈, 음성 인코더, 사전 훈련 및 지시 훈련 데이터 크기의 영향 평가.
  • 모델 아키텍처, 모듈 구성(예: 시간적 또는 음성 모듈 유무) 및 데이터 크기 영향을 다차원적으로 분석해 성능 결정 요인을 분리.
  • GPT 기반 메트릭을 활용해 장문의 응답 평가. 결과적으로 현재 모델들은 유창하지만 종종 잘못되거나 관련성이 없는 답변을 생성함을 확인. 이는 고도의 유창성에도 불구하고 신뢰할 수 있는 추론 및 사실 기반 이해의 부재를 시사함.

실험 결과

연구 질문

  • RQ1현재 Video-LLM은 시간적 추론 및 맥락 인식이 요구되는 과제에서 영상 콘텐츠에 대해 인간 수준의 이해를 얼마나 달성하고 있는가?
  • RQ2영상에 보이는 내용을 초월해 외부 이전 지식(예: 스포츠, 음악, 문화적 맥락)을 영상 기반 대규모 언어 모델이 얼마나 잘 통합할 수 있는가?
  • RQ3시간 모듈 및 음성 인코더와 같은 아키텍처 구성 요소가 다양한 이해 수준에서 Video-LLM 성능에 어떤 영향을 미치는가?
  • RQ4사전 훈련 및 지시 훈련 데이터 크기가 영상 전용 이해 능력에 있어 Video-LLM 성능에 어떤 영향을 미치는가?
  • RQ5확률 기반, T5 기반, GPT 기반 중 어떤 평가 메트릭이 개방형 및 다중 대화 설정에서 Video-LLM 출력의 정확도를 가장 신뢰성 있게 측정하는가?

주요 결과

  • 기본적인 외부 지식이 필요한 다중 선택 질문에서 유일하게 정답을 제공한 것은 Video-ChatGPT 뿐이었으며, 이는 단순한 외부 지식 통합 실패가 광범위하게 발생하고 있음을 시사한다.
  • GPT 기반 메트릭이 확률 기반 및 T5 기반 메트릭보다 모델 출력 평가에서 뛰어난 성능을 보였으며, 특히 파rameter 수가 적고 출력이 불안정한 모델에서 두드러졌다.
  • 대규모 영상 지시 훈련 데이터(예: Video-ChatGPT, Otter)로 훈련된 모델들이 이미지 데이터로 훈련되거나 최소한의 훈련만 받은 모델들보다 유의미하게 뛰어난 성능을 보였으며, 영상 전용 미세조정의 중요성을 강조한다.
  • 사전 훈련 데이터 크기의 영향은 제한적이었으며, 현재의 시각적 인코더들이 이미 다중 모odal 데이터 기반으로 잘 사전 훈련되어 있음을 시사한다. 반면 지시 훈련 데이터 크기는 성능 예측에 강력한 예측 변수였다.
  • 시간 모듈 또는 음성 인코더의 포함 여부가 일관되게 성능 향상을 이끌지는 못했으며, 이는 현재의 모듈 설계가 시간적 또는 음성 신호를 효과적으로 활용하지 못하고 있음을 시사한다.
  • 현재 Video-LLM은 인간처럼 자연스럽고 흐름 있는 텍스트를 생성하지만, 결정 과제 및 공통체계적 추론 과제에서 신뢰할 수 있는 추론 및 사실 기반 이해의 부재를 보이며, 인공통합지능 향한 핵심 격차가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.