Skip to main content
QUICK REVIEW

[論文レビュー] MovieChat: From Dense Token to Sparse Memory for Long Video Understanding

Enxin Song, Wenhao Chai|arXiv (Cornell University)|Jul 31, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

MovieChatは、密度の高い動画トークンのスライディングウィンドウと、短期記憶(動的)および長期記憶(圧縮)の2段階記憶メカニズムを用いる、記憶拡張型の新規フレームワークを提案する。これにより、大規模言語モデルにおける長時間動画理解が効率的に行える。本手法は、10,000フレーム以上の長時間動画で最先端の性能を達成し、フレームあたりのVRAMコストを従来手法比10,000分の1にまで低減した。また、1,000本の長時間動画と14,000組の人的アノテーションQAペアを含むMovieChat-1Kベンチマークを導入した。

ABSTRACT

Recently, integrating video foundation models and large language models to build a video understanding system can overcome the limitations of specific pre-defined vision tasks. Yet, existing systems can only handle videos with very few frames. For long videos, the computation complexity, memory cost, and long-term temporal connection impose additional challenges. Taking advantage of the Atkinson-Shiffrin memory model, with tokens in Transformers being employed as the carriers of memory in combination with our specially designed memory mechanism, we propose the MovieChat to overcome these challenges. MovieChat achieves state-of-the-art performance in long video understanding, along with the released MovieChat-1K benchmark with 1K long video and 14K manual annotations for validation of the effectiveness of our method.

研究の動機と目的

  • マルチモodal LLMにおける長時間動画処理の高コストな計算と記憶を解決すること。
  • 長時間動画理解における長期的時間的依存関係を維持する課題を克服すること。
  • 最小限の記憶オーバーヘッドでエンドツーエンドの長時間動画推論を可能にするシステムの開発。
  • 長時間動画理解システムを評価するための標準化されたベンチマークの確立。
  • 生物学的にインspiredされた記憶アーキテクチャを用いて、ビジョンファウンデーションモデルとLLMを統合し、スケーラブルな動画理解を実現すること。

提案手法

  • フレームから密度の高い動画トークンを抽出するためのスライディングウィンドウを用い、これを短期記憶バッファで逐次処理する。
  • 固定長の短期記憶を採用し、最も古いトークンを破棄するとともに、それらを統合して長期記憶に移行する。
  • 統合された短期記憶トークンを圧縮するためのプロジェクション層を適用し、コンactな永続的長期記憶表現を生成する。
  • 長期記憶表現を大規模言語モデルと統合し、ユーザーとの対話と推論を可能にする。
  • Atkinson-Shiffrin記憶モデルをインスピレーションとし、短期記憶をバッファとして、長期記憶を安定的かつ圧縮されたストレージとしてモデル化する。
  • 前回のウィンドウからの統合トークンを次回のウィンドウの初期化に用いることで、代替の初期化戦略に比べて一貫性と性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1記憶拡張アーキテクチャは、マルチモダルLLMにおける長時間動画理解の計算コストと記憶コストを効果的に低減できるか?
  • RQ2短期記憶バッファ長と圧縮のバランスが、長時間動画タスクのパフォーマンスに与える影響は何か?
  • RQ3生物学的にインスパイアされた記憶メカニズムは、動画理解における長期的時間的推論を向上させられるか?
  • RQ4短期記憶の初期化戦略の違いが、下流タスクのパフォーマンスに与える影響は何か?
  • RQ5統合フレームワークは、長時間動画におけるグローバルモードおよびブレイクポイントモードの両方のQAをどの程度効果的にサポートできるか?

主な発見

  • MovieChatは、MovieChat-1Kベンチマークにおいて、時間的理解(TU)で3.12、一貫性(CO)で3.12の最先端のパフォーマンスを達成した。
  • 本システムは、24GBのVRAMのみで10,000フレーム以上の動画の推論を可能とし、従来手法と比較してフレームあたりのVRAMコストが10,000分の1にまで低減された。
  • パフォーマンスは中間的な記憶バッファ長でピークに達し、情報保持と圧縮損失の最適なトレードオフが示された。
  • 前回のウィンドウからの統合トークンを初期化に用いる戦略が最も優れたパフォーマンスを示し、最後のトークンや一様サンプリングの方法を上回った。
  • 本フレームワークは、アニメ、テレビシリーズ、コンピレーションなど多様な長時間動画タイプにおいて、グローバルモードおよびブレイクポイントモードの両方で強力なパフォーマンスを維持した。
  • MovieChat-1Kベンチマークは、14,000組のQAペアを含む高品質な人的アノテーションデータを示しており、長時間動画理解システムの信頼性ある評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。