[논문 리뷰] Foundation Models for Video Understanding: A Survey
이 종합 검토는 비디오 기초 모델(ViFMs)에 대한 최초의 종합적 분석을 제시하며, 이미지 기반, 비디오 기반, 통합 기초 모델(UFMs)으로 분류한다. 14개의 비디오 작업을 통해 200개 이상의 ViFMs를 평가한 결과, 이미지 기반 모델이 비디오 전용 모델보다 뛰어난 성능을 보이며, 다중모달 사전학습을 통한 UFMs가 뛰어난 성능을 보여, 향후 비디오 이해 연구를 위한 길잡이가 된다.
Video Foundation Models (ViFMs) aim to learn a general-purpose representation for various video understanding tasks. Leveraging large-scale datasets and powerful models, ViFMs achieve this by capturing robust and generic features from video data. This survey analyzes over 200 video foundational models, offering a comprehensive overview of benchmarks and evaluation metrics across 14 distinct video tasks categorized into 3 main categories. Additionally, we offer an in-depth performance analysis of these models for the 6 most common video tasks. We categorize ViFMs into three categories: 1) Image-based ViFMs, which adapt existing image models for video tasks, 2) Video-Based ViFMs, which utilize video-specific encoding methods, and 3) Universal Foundational Models (UFMs), which combine multiple modalities (image, video, audio, and text etc.) within a single framework. By comparing the performance of various ViFMs on different tasks, this survey offers valuable insights into their strengths and weaknesses, guiding future advancements in video understanding. Our analysis surprisingly reveals that image-based foundation models consistently outperform video-based models on most video understanding tasks. Additionally, UFMs, which leverage diverse modalities, demonstrate superior performance on video tasks. We share the comprehensive list of ViFMs studied in this work at: \url{https://github.com/NeeluMadan/ViFM_Survey.git}
연구 동기 및 목표
- 다양한 비디오 이해 작업을 대상으로 비디오 기초 모델(ViFMs)에 대한 최초의 종합적 검토를 제공하기 위해.
- ViFMs를 세 가지 유형으로 분류하기 위해: 이미지 기반, 비디오 기반, 다중모달을 통합한 통합 기초 모델(UFMs).
- 14개의 비디오 작업을 세 가지 시간적 범주로 묶어 기준 평가 지표와 벤치마크를 분석하기 위해.
- 다양한 작업 간 ViFM 성능를 비교하고 핵심 강점, 약점, 연구 격차를 규명하기 위해.
- 인과적 추론, 시점 불변성, 도메인 적응, 효율성 등 아직 탐색되지 않은 방향을 제시함으로써 향후 연구를 이끌기 위해.
제안 방법
- 200개 이상의 ViFMs를 세 그룹으로 체계적으로 분류: 이미지 기반(이미지 모델에서 미세조정), 비디오 기반(비디오 데이터로 훈련), UFMs(이미지, 비디오, 오디오, 텍스트 등 다중모달 사전학습).
- 14개의 비디오 이해 작업을 세 가지 시간적 범주로 분류: 동작 인식, 동작 로컬라이제이션, 장시간 비디오 이해.
- 각 작업 범주에 대해 데이터셋과 평가 지표의 포괄적인 목록을 수집 및 분석하기 위해.
- 표준화된 벤치마크를 사용해 6개의 일반적인 비디오 작업에서 ViFMs의 성능을 상세히 비교하기 위해.
- 정성적 및 정량적 분석을 통해 다양한 사전학습 전략과 모달리티 간의 모델 행동, 일반화 능력, 강건성 평가하기 위해.
- 메모리 제약, 시점 민감성, 도메인 이동, 계산 비효율성 등의 도전 과제와 함께 새로운 추세 규명하기 위해.

실험 결과
연구 질문
- RQ1표준 비디오 이해 작업에서 이미지 기반 모델, 비디오 기반 모델, 통합 기초 모델 간의 성능는 어떻게 비교되는가?
- RQ2왜 이미지 기반 기초 모델이 대부분의 비디오 작업에서 비디오 전용 모델보다 뛰어나게 성능을 내는가?
- RQ3다중모달(예: 시각-언어-오디오-텍스트) 통합 기초 모델이 비디오 이해 작업에서 성능 향상에 얼마나 기여하는가?
- RQ4현재 ViFMs가 장시간 비디오, 시점 변화, 도메인 이동, 엣지 장치 배포를 다룰 때 겪는 주요 제약은 무엇인가?
- RQ5인과적 추론과 시점 불변 표현은 ViFMs의 강건성과 일반화 능력을 어떻게 향상시킬 수 있는가?
주요 결과
- 이미지 기반 기초 모델은 정적 이미지에서 사전학습된 후에도 대부분의 비디오 이해 작업에서 비디오 기반 모델보다 뛰어난 성능을 보인다.
- 다양한 모달리티(텍스트, 오디오, 비디오 포함)를 통합한 통합 기초 모델(UFMs)은 광범위한 비디오 작업에서 뛰어난 성능을 보여준다.
- 이 검토는 ViFMs의 도메인 적응 분야에 심각한 연구 격차가 있음을 규명하며, 조명 변화나 위치 변화와 같은 도메인 이동에 대해 현재 모델이 제한된 강건성을 보임을 확인한다.
- 장시간 비디오 이해를 향상시키기 위해 인과적 추론이 향후 유망한 연구 방향으로 지목되며, '왜', '다음에는 무엇일까', '만약에' 등의 질문에 답할 수 있도록 한다.
- 시점 불변성은 여전히 도전 과제이며, 특히 자기 시점 또는 조감도 비디오의 경우, 3D 인식 또는 시점 일관성 있는 표현 학습이 필요함을 시사한다.
- 효율성은 여전히 핵심적인 제약 요소이며, ViFMs는 종종 수십억 개의 파라미터와 높은 계산 자원을 요구하여 엣지 장치에의 배포를 제한한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.