Skip to main content
QUICK REVIEW

[논문 리뷰] MLVU: Benchmarking Multi-task Long Video Understanding

Junjie Zhou, Yan Shu|arXiv (Cornell University)|2024. 06. 06.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 장시간 영상(3~120분), 다양한 영상 장르(영화, 감시 영상, 1인칭 시점, 만화, 게임 영상) 및 9개의 다양한 평가 과제를 포함하는 다중 작업 장시간 영상 이해를 위한 종합적 벤치마크인 MLVU를 소개한다. 20개의 MLLM에 대한 실증적 평가 결과, 영상 길이가 길어질수록 성능 저하가 심각하게 나타났으며, GPT-4o조차도 다중 선택 과제에서 평균 정확도 64.6%에 그쳐 장기적 맥락 추론 및 전반적 영상 이해 분야에서 큰 과제가 있음을 시사한다.

ABSTRACT

The evaluation of Long Video Understanding (LVU) performance poses an important but challenging research problem. Despite previous efforts, the existing video understanding benchmarks are severely constrained by several issues, especially the insufficient lengths of videos, a lack of diversity in video types and evaluation tasks, and the inappropriateness for evaluating LVU performances. To address the above problems, we propose a new benchmark called MLVU (Multi-task Long Video Understanding Benchmark) for the comprehensive and in-depth evaluation of LVU. MLVU presents the following critical values: extit{1)} The substantial and flexible extension of video lengths, which enables the benchmark to evaluate LVU performance across a wide range of durations. extit{2)} The inclusion of various video genres, e.g., movies, surveillance footage, egocentric videos, cartoons, game videos, etc., which reflects the models' LVU performances in different scenarios. extit{3)} The development of diversified evaluation tasks, which enables a comprehensive examination of MLLMs' key abilities in long-video understanding. The empirical study with 23 latest MLLMs reveals significant room for improvement in today's technique, as all existing methods struggle with most of the evaluation tasks and exhibit severe performance degradation when handling longer videos. Additionally, it suggests that factors such as context length, image-understanding ability, and the choice of LLM backbone can play critical roles in future advancements. We anticipate that MLVU will advance the research of long video understanding by providing a comprehensive and in-depth analysis of MLLMs.

연구 동기 및 목표

  • 장시간 영상 이해(LVU)를 위한 종합적 벤치마크의 부족을 해결하고, 다양한 영상 길이, 장르, 평가 과제를 지원하는 것을 목적으로 한다.
  • 기존 벤치마크의 한계를 극복하기 위해, 일반적으로 몇 초 내외의 짧은 영상, 단일 영상 유형에 집중하거나 장기적 맥락 추론이 필요한 것이 아닌 단순 과제를 포함하는 문제를 해결하고자 한다.
  • 다양한 이해 능력(예: 추론, 요약, 동작 인식)을 갖춘 멀티모odal LLM(MLLM)을 통합적으로 깊이 있게 평가할 수 있도록 하는 것을 목적으로 한다.
  • MLLM 성능에 영향을 주는 핵심 요인을 특정하고자 하며, 이는 맥락 길이, 이미지 이해 품질, LLM 기반 모델 선택 등이다.
  • 연구를 가속화하기 위해 공개 가능하고 확장 가능한 벤치마크를 제공하는 것

제안 방법

  • 장기간 영상(3분에서 2시간)을 활용하여 다양한 시간적 범위를 평가할 수 있도록 구성한다. 평균 지속 시간은 12분이다.
  • 영상은 여러 클립(예: 첫 3분, 6분, 전체 길이)으로 분할되어 다양한 시간 범위에서 과제 평가가 가능하도록 한다.
  • 다양한 평가 과제 9개(다중 선택 질문 응답, 자유형 캡션 작성, 동작 수 세기, 시간 순서 정렬 등)를 포함하며, 추론, 인식, 요약 등 다양한 영역을 커버한다.
  • 과제는 국소적 클립 수준의 정보 또는 전반적 영상 수준의 맥락이 필요하도록 설계되어, MLLM 능력의 종합적 평가를 보장한다.
  • 저작권 위험을 최소화하기 위해 철저한 코딩을 통해 애니메이션 처리, 해상도 감소, 약간의 프레임 간격 조절 등을 실시한다.
  • 벤치마크는 GitHub 및 Hugging Face에 CC-BY-NC-SA 4.0 라이선스 하에 공개되며, 향후 업데이트 및 기여를 지원한다.

실험 결과

연구 질문

  • RQ1영상 길이가 10분을 초과할 경우 현재 MLLM의 장시간 영상 이해 과제에서 성능은 어떻게 되는가?
  • RQ2행동 수 세기나 시간 순서 정렬과 같이 전반적 영상 맥락이 필요한 과제에서 MLLM은 어느 정도 어려움을 겪는가?
  • RQ3LLM 기반 모델의 선택과 모델의 맥락 길이가 장시간 영상 이해 과제에서 성능에 어떤 영향을 미치는가?
  • RQ4장시간 영상 이해에서 전문가 모델과 오픈소스 MLLM 간의 성능 격차는 어느 정도인가?
  • RQ5다양한 영상 장르(예: 감시 영상, 1인칭 시점, 만화)가 MLLM 성능과 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • GPT-4o는 평가된 20개의 MLLM 중에서 가장 높은 성능을 기록했으며, 다중 선택 과제에서 평균 정확도 64.6%를 기록하여 향후 개선 여지가 크다는 것을 시사한다.
  • 모든 MLLM이 영상 길이가 길어질수록 심각한 성능 저하를 경험했으며, 특히 세밀한 장기적 추론이 필요한 과제에서 두드러졌다.
  • 행동 수 세기, 시간 순서 정렬, 영상 요약과 같은 과제는 모든 모델에서 끊임없이 과제로 남아 있어 장기적 맥락 이해 능력의 한계를 보여준다.
  • 오픈소스 MLLM은 단일 이미지 과제에서는 뛰어난 성능을 보였지만, GPT-4o와 같은 전문 모델에 비해 장시간 영상 이해에서 뚜렷한 성능 열등성을 보였다.
  • 맥락 길이와 이미지 이해 품질은 MLLM 성능에 영향을 주는 핵심 요소로 규명되었으며, 낮은 품질의 이미지 인코더는 뚜렷한 성능 저하를 초래했다.
  • 벤치마크는 기존 많은 과제들이 LVU 평가에 적합하지 않음을 드러냈다. 이는 단일 프레임 또는 텍스트 단서만으로도 해결 가능해 장기적 영상 이해가 필요한 것은 아님을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.