Skip to main content
QUICK REVIEW

[論文レビュー] MeMViT: Memory-Augmented Multiscale Vision Transformer for Efficient Long-Term Video Recognition

Chao-Yuan Wu, Yanghao Li|arXiv (Cornell University)|Jan 20, 2022
Human Pose and Action Recognition被引用数 9
ひとこと要約

MeMViT は、フレーム間で時間的文脈をキャッシュして再利用することで、計算コストの増加を最小限に抑えながら、従来モデルの30倍の長期間の動画認識を実現するメモリ拡張型マルチスケールビジョントランスフォーマーを提案する。計算量は4.5%増加にとどまり、AVA、EPIC-Kitchens-100、およびアクション予測ベンチマークで、キャッシュされたキーと値に対する階層的自己注意機構と、効率性を高めるための共同メモリ圧縮モジュールを活用することで、既存手法を上回る性能を達成する。

ABSTRACT

While today's video recognition systems parse snapshots or short clips accurately, they cannot connect the dots and reason across a longer range of time yet. Most existing video architectures can only process <5 seconds of a video without hitting the computation or memory bottlenecks. In this paper, we propose a new strategy to overcome this challenge. Instead of trying to process more frames at once like most existing methods, we propose to process videos in an online fashion and cache "memory" at each iteration. Through the memory, the model can reference prior context for long-term modeling, with only a marginal cost. Based on this idea, we build MeMViT, a Memory-augmented Multiscale Vision Transformer, that has a temporal support 30x longer than existing models with only 4.5% more compute; traditional methods need >3,000% more compute to do the same. On a wide range of settings, the increased temporal support enabled by MeMViT brings large gains in recognition accuracy consistently. MeMViT obtains state-of-the-art results on the AVA, EPIC-Kitchens-100 action classification, and action anticipation datasets. Code and models are available at https://github.com/facebookresearch/memvit.

研究の動機と目的

  • 現在のモデルが5秒の制限を超えて効率的な長期間の動画理解を可能にすること。
  • 長期間の動画処理における計算およびメモリのボトル neck を回避するため、全長のシーケンスを一度に処理しないこと。
  • 過去の文脈にアクセス可能なオンラインで段階的な動画モデリングが可能なメモリベースのメカニズムを開発すること。
  • 計算コストを著しく増加させることなく、長距離の行動理解タスクにおける認識精度を向上させること。
  • 顕著な長距離の手がかりのみを保持する圧縮メモリモジュールを用いたエンドツーエンドの学習を可能にすること。

提案手法

  • MeMViT は動画をオンラインで処理し、以前のクリップから得たキーと値の形で『メモリ』をキャッシュし、自己注意機構に活用する。
  • 各推論ステップで、クエリは現在のフレームのトークンと、事前にキャッシュされたキー/値に注目することで、時間的に効果的な受容 field を拡張する。
  • 全テンソルベースのアプローチと比較してメモリコストを削減するため、時間的・高さ・幅方向に分解された相対的位置埋め込みを用いる。
  • エンドツーエンドで学習される共同メモリ圧縮モジュールにより、過去のフレームからの最も情報量の多い特徴量のみを保持し、メモリの断片を最小限に抑える。
  • マルチスケール特徴階層を持つ MViT をベースとし、因果的アテンションとプーリングを用いて自己回帰的一致性を確保することで、長距離モデリングに適応させる。
  • 段階的事前学習を採用し、単一のクリップから10秒のフル動画まで、徐々に動画長を延長することで、学習の安定化と一般化性能の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1計算量やメモリ使用量を比例的に増加させることなく、動画モデルが著しく長い有効な時間的文脈を達成できるか?
  • RQ2過去のフレームからのアテンションキーと値をキャッシュして再利用することで、長期間の行動認識精度がどのように向上するか?
  • RQ3長期間のシーケンスを一度のフォワードパスで処理する標準的な動画トランスフォーマーよりも、メモリ拡張設計が優れた性能を発揮できるか?
  • RQ4共同メモリ圧縮モジュールは、長距離動画タスクの性能を保持しつつ、どの程度メモリのオーバーヘッドを削減できるか?
  • RQ5メモリへのアクセスを伴うオンラインで段階的な処理は、長期間の動画理解ベンチマークにおける一般化性能と耐性を向上させるか?

主な発見

  • MeMViT は、従来モデルの30倍の長期間の文脈を実現するが、計算量はわずか4.5%増加にとどまる。一方、同程度の性能向上を達成するには、従来手法では3,000%以上の計算量増加が必要となる。
  • AVA データセットでは、MeMViT は空間的・時間的行動局所化タスクで最先端の性能を達成し、長距離推論能力の向上を示している。
  • EPIC-Kitchens-100 では、行動分類および行動予測タスクの両方で、新たな最先端性能を達成しており、短期的ベースラインと比較して顕著な精度向上を示している。
  • アブレーションスタディの結果、分類器の前にトランスフォーマーレイヤーを追加するとmAPが27.0から27.0に向上し、フルフレーム特徴量を用いることでmAPは26.6に上昇した。
  • 因果的バージョンの MeMViT は、未来情報の漏洩を回避しつつ、EPIC-Kitchens-100 の予測ベンチマークで強力な性能を達成した。
  • 段階的事前学習により、特に初期学習段階でモデルの収束性と性能が向上し、徐々に長期間の動画セグメントにさらされることで、学習の安定性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。