[論文レビュー] Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
本論文は、複雑な動画タスクを段階的な知覚的・認知的サブ問題に分解することで、人間水準の動画理解を可能にする新しい推論フレームワークである Video-of-Thought (VoT) を紹介する。MotionEpic と呼ばれる、詳細な空間的・時間的シーングラフ (STSG) のグランドトゥルースを備えた動画マルチモodal Large Language Model (MLLM) に基づき、ピクセルレベルの知覚、軌道追跡、常識的推論を Chain-of-Thought 方式で統合することで、複雑な動画QAベンチマークで最先端の性能を達成している。
Existing research of video understanding still struggles to achieve in-depth comprehension and reasoning in complex videos, primarily due to the under-exploration of two key bottlenecks: fine-grained spatial-temporal perceptive understanding and cognitive-level video scene comprehension. This paper bridges the gap by presenting a novel solution. We first introduce a novel video Multimodal Large Language Model (MLLM), MotionEpic, which achieves fine-grained pixel-level spatial-temporal video grounding by integrating video spatial-temporal scene graph (STSG) representation. Building upon MotionEpic, we then develop a Video-of-Thought (VoT) reasoning framework. VoT inherits the Chain-of-Thought (CoT) core, breaking down a complex task into simpler and manageable sub-problems, and addressing them step-by-step from a low-level pixel perception to high-level cognitive interpretation. Extensive experiments across various complex video QA benchmarks demonstrate that our overall framework strikingly boosts existing state-of-the-art. To our knowledge, this is the first attempt at successfully implementing the CoT technique for achieving human-level video reasoning, where we show great potential in extending it to a wider range of video understanding scenarios. Project is open at https://haofei.vip/VoT
研究の動機と目的
- 複雑な動画における細分化された空間的・時間的知覚と認知的意味論を要する、深層的動画理解のギャップを埋めること。
- 浅い知覚的理解にとどまり、構造的な推論を欠く既存の動画 MLLM の限界を克服すること。
- Chain-of-Thought (CoT) プロンプトを動画入力に適応し、ピクセルレベルのグランドトゥルースから高次元の認知的解釈に至るマルチホップ推論を可能にする統合的アプローチを模索すること。
- STSG表現への動画コンテンツのグランドトゥルースを可能とし、STSG対応およびSTSG非対応の両方の推論をサポートする動画 MLLM、MotionEpic を開発すること。
- 構造的で段階的な推論が、複雑な動画質問応答において正確性と頑健性を顕著に向上させることを実証すること。
提案手法
- 細分化されたピクセルレベルのグランドトゥルースを可能にするために、動画フレームと空間的・時間的シーングラフ (STSG) を共同で符号化する動画 MLLM である MotionEpic を提案する。
- STSGアノテーションを用いたグランドトゥルースに特化したチューニング段階を導入し、動画入力を構造的なシーン表現に一致させる。
- 二段階の訓練戦略を採用する:第一段階では、監視のもとで動画をSTSGにグランドトゥルースする。第二段階では、STSG入力を必要としない自律的なSTSG解析と推論のためのファインチューニングを実施する。
- VoTフレームワークを、動画QAを段階的なステップに分解するCoTスタイルの推論エンジンとして設計する:ターゲットのグランドトゥルース、軌道追跡、インタラクション解析、回答ランク付け。
- 事実に基づく常識的知識を活用して行動や相互作用を解釈し、認知的に整合的で説明可能な推論を保証する。
- STSGグランドトゥルースと生成の最適化を明示的に行う損失項 𝒫₂ と 𝒫₄ を使用し、これらは下流の推論性能において極めて重要である。

実験結果
リサーチクエスチョン
- RQ1細分化されたSTSGグランドトゥルースを備えた動画MLLMは、複雑な動画理解における知覚の正確性を顕著に向上させるか?
- RQ2マルチモーダル入力に適応した場合、Chain-of-Thought (CoT) パラダイムはどの程度有効か?
- RQ3常識的知識を統合することで、視覚的知覚を超えて動画コンテンツの推論がどの程度向上するか?
- RQ4構造的なシーン表現 (STSG) は、幻覚を低減し、推論の頑健性を向上させる役割を果たすか?
- RQ5統合されたフレームワークは、STSG対応およびSTSG非対応の両方の推論を維持しながら、高い性能を発揮できるか?
主な発見
- VoTフレームワークを備えたMotionEpicは、複雑な動画QAベンチマークで最先端の性能を達成し、CoTを用いたVideo-LLaVAを含む既存モデルを上回っている。
- アブレーションスタディの結果、STSGグランドトゥルースと生成に関連する損失項 𝒫₂ と 𝒫₄ を削除すると性能が著しく低下し、これらが推論性能において極めて重要な役割を果たしていることが実証された。
- 200件の難易度の高い例に対する人間評価では、MotionEpicにVoTを組み合わせたモデルが、行動の意味論と常識的理解において人間水準の推論と同等の性能を示した。
- 定性的な事例研究では、VoTが正確なグランドトゥルースと事実に基づく推論を組み合わせることで、トレーナーが犬を訓練するような複雑なシーンを正しく同定しているのに対し、ベースラインは失敗していることが示された。
- VoTフレームワークは、因果的ダイナミクスや社会的相互作用に関する推論において、ベースラインのCoT手法と比較して誤り率を顕著に低減している。
- 構造的で段階的な推論プロセスのおかげで、システムは未学習の動画推論タスクに対しても強力なゼロショット一般化能力を維持している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。