[논문 리뷰] Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
이 논문은 복잡한 비디오 작업을 단계별로 인지적·인지적 하위 문제로 분해함으로써 인간 수준의 비디오 이해를 가능하게 하는 새로운 추론 프레임워크인 Video-of-Thought (VoT)를 소개한다. 미세한 시공간 시나리오 그래프(STSG) 기반의 비디오 다중모odal 대규모 언어 모델(MLLM)인 MotionEpic에 기반하여, VoT는 체인-오브-스스로 방식으로 픽셀 수준의 인식, 궤적 추적, 일반 지식 추론를 통합함으로써 복잡한 비디오 질의응답 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Existing research of video understanding still struggles to achieve in-depth comprehension and reasoning in complex videos, primarily due to the under-exploration of two key bottlenecks: fine-grained spatial-temporal perceptive understanding and cognitive-level video scene comprehension. This paper bridges the gap by presenting a novel solution. We first introduce a novel video Multimodal Large Language Model (MLLM), MotionEpic, which achieves fine-grained pixel-level spatial-temporal video grounding by integrating video spatial-temporal scene graph (STSG) representation. Building upon MotionEpic, we then develop a Video-of-Thought (VoT) reasoning framework. VoT inherits the Chain-of-Thought (CoT) core, breaking down a complex task into simpler and manageable sub-problems, and addressing them step-by-step from a low-level pixel perception to high-level cognitive interpretation. Extensive experiments across various complex video QA benchmarks demonstrate that our overall framework strikingly boosts existing state-of-the-art. To our knowledge, this is the first attempt at successfully implementing the CoT technique for achieving human-level video reasoning, where we show great potential in extending it to a wider range of video understanding scenarios. Project is open at https://haofei.vip/VoT
연구 동기 및 목표
- 복잡한 비디오에서 미세한 시공간 인식과 고도의 인지적 의미를 요구하는 깊이 있는 비디오 이해의 격차를 해소하기 위해.
- 기존의 비디오 MLLM가 얕은 인지적 이해에 집중하고 구조화된 추론 능력이 부족한 점을 극복하기 위해.
- 체인-오브-스스로(Chain-of-Thought, CoT) 프롬프팅을 비디오 입력에 적응시켜 픽셀 수준의 기반에서 고도의 인지적 해석으로 이르는 다단계 추론을 가능하게 하기 위해.
- 비디오 컨텐츠를 STSG 표현으로 정렬할 수 있고, STSG 기반 및 STSG 비기반 추론을 모두 지원할 수 있는 비디오 MLLM인 MotionEpic을 개발하기 위해.
- 구조화된 단계별 추론이 복잡한 비디오 질의응답에서 정확성과 강인성을 크게 향상시킨다는 것을 입증하기 위해.
제안 방법
- 미세한 픽셀 수준의 기반을 위해 비디오 프레임과 시공간 시나리오 그래프(STSG)를 동시에 인코딩하는 비디오 MLLM인 MotionEpic을 제안한다.
- STSG 애너테이션을 사용하여 비디오 입력을 구조화된 시나리오 표현과 정렬하는 기반 정렬 테이닝 단계를 도입한다.
- 이중 단계 학습 전략을 활용한다: 첫 번째로, 지도 학습을 통해 비디오를 STSG에 기반 정렬한다; 두 번째로, STSG 입력 없이도 자율적인 STSG 파싱과 추론을 위한 파인튜닝을 수행한다.
- 비디오 QA를 순차적 단계로 분해하는 CoT 스타일의 추론 엔진으로서 Video-of-Thought (VoT) 프레임워크를 설계한다: 대상 기반 정렬, 궤적 추적, 상호작용 분석, 답변 순위 매기기.
- 사실 기반 일반 지식을 활용하여 행동과 상호작용을 해석함으로써 인지적으로 일관되고 설명 가능한 추론을 보장한다.
- STSG 기반 정렬과 생성을 명시적으로 최적화하기 위해 손실 성분 𝒫₂와 𝒫₄를 사용한다. 이는 후속 추론 성능에 매우 중요한 요소이다.

실험 결과
연구 질문
- RQ1미세한 STSG 기반 정렬을 갖춘 비디오 MLLM가 복잡한 비디오 이해에서 인지 정확도를 크게 향상시킬 수 있는가?
- RQ2다중모달 입력에 적응시킨 체인-오브-스스로(CoT) 파рад림이 비디오 추론에 얼마나 효과적인가?
- RQ3일반 지식 통합이 시각적 인식을 초월하여 비디오 컨텐츠에 대한 추론 능력을 얼마나 향상시키는가?
- RQ4구조화된 시나리오 표현(STSG)이 환영 현상 감소와 추론 강인성 향상에 어떤 역할을 하는가?
- RQ5통합 프레임워크가 STSG 기반 및 STSG 비기반 추론을 모두 지원하면서도 높은 성능을 유지할 수 있는가?
주요 결과
- VoT 프레임워크를 갖춘 MotionEpic는 기존의 Video-LLaVA와 CoT를 사용한 모델들을 능가하는 복잡한 비디오 질의응답 벤치마크에서 최신 기술 수준의 성능을 달성한다.
- 제거 실험 결과, STSG 기반 정렬 및 생성과 관련된 손실 성분 𝒫₂와 𝒫₄를 제거할 경우 성능 저하가 가장 크게 발생함을 확인하여 이들의 핵심적 역할을 입증한다.
- 200개의 어려운 예제에 대한 인간 평가 결과, VoT를 갖춘 MotionEpic는 특히 행동 의미와 일반 지식 이해 측면에서 인간 수준의 추론 능력과 유사한 성능을 보였다.
- 정성적 사례 연구를 통해 VoT는 정확한 기반 정렬과 사실 기반 추론을 결합하여 복잡한 장면(예: 트레이너가 개를 훈련시키는 장면)을 정확히 식별하는 데 성공했으며, 기준 모델들은 실패함을 확인했다.
- VoT 프레임워크는 특히 원인-결과 역학과 사회적 상호작용에 대한 추론에서 기존의 CoT 기반 방법에 비해 오류율을 크게 감소시켰다.
- 구조화된 단계별 추론 과정 덕분에 시스템은 새로운 비디오 추론 작업에 대해 조건 없이도 강력한 zero-shot 일반화 능력을 유지한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.