Skip to main content
QUICK REVIEW

[論文レビュー] Temporally-Adaptive Models for Efficient Video Understanding

Ziyuan Huang, Shiwei Zhang|arXiv (Cornell University)|Aug 10, 2023
Human Pose and Action Recognition被引用数 7
ひとこと要約

本論文は、局所的およびグローバルな時間的文脈を用いてフレームごとにカーネル重みを動的にキャリブレーションすることで、空間畳み込みに動的時間モデリングを組み込むプラグインモジュールであるTemporally-Adaptive Convolutions (TAdaConv)を提案する。TAdaConvは効率性とパフォーマンスを向上させ、TAdaConvNeXtV2 や TAdaFormer といったモデルが、計算量を削減しつつ強力な一般化性能を示すことで、アクション認識および局所化ベンチマークで最先端の結果を達成する。

ABSTRACT

Spatial convolutions are extensively used in numerous deep video models. It fundamentally assumes spatio-temporal invariance, i.e., using shared weights for every location in different frames. This work presents Temporally-Adaptive Convolutions (TAdaConv) for video understanding, which shows that adaptive weight calibration along the temporal dimension is an efficient way to facilitate modeling complex temporal dynamics in videos. Specifically, TAdaConv empowers spatial convolutions with temporal modeling abilities by calibrating the convolution weights for each frame according to its local and global temporal context. Compared to existing operations for temporal modeling, TAdaConv is more efficient as it operates over the convolution kernels instead of the features, whose dimension is an order of magnitude smaller than the spatial resolutions. Further, kernel calibration brings an increased model capacity. Based on this readily plug-in operation TAdaConv as well as its extension, i.e., TAdaConvV2, we construct TAdaBlocks to empower ConvNeXt and Vision Transformer to have strong temporal modeling capabilities. Empirical results show TAdaConvNeXtV2 and TAdaFormer perform competitively against state-of-the-art convolutional and Transformer-based models in various video understanding benchmarks. Our codes and models are released at: https://github.com/alibaba-mmai-research/TAdaConv.

研究の動機と目的

  • 動画理解における標準的な空間畳み込みの非効率性および限られた時間的モデリング能力を解決すること。
  • 事前学習済み重みを損なわず、高い計算コストを伴わずにフレーム固有のカーネル適応を可能にすること。
  • カーネルキャリブレーションに局所的およびグローバルな時間的文脈を組み込むことで、畳み込み型およびTransformerベースの動画モデルにおける時間的モデリングを向上させること。
  • 効率性とスケーラビリティを維持しながら、最先端のモデルと同等のパフォーマンスを達成すること。
  • 大規模な事前学習および事後事前学習を通じて、ゼロショットおよびフェイワショット一般化の強化を実証すること。

提案手法

  • TAdaConvは、各フレームにおける畳み込みカーネルを $\mathbf{W}_t = \bm{\alpha}_t \cdot \mathbf{W}_b$ として因子化する。ここで $\mathbf{W}_b$ は学習可能なベース重み、$\bm{\alpha}_t$ は時間的キャリブレーション重みである。
  • キャリブレーション重み $\bm{\alpha}_t$ は、隣接フレームの記述子とグローバルな動画記述子を用いて、マルチヘッド自己注意機構により長距離時間的依存性を捉える。
  • TAdaBlocks は、ConvNeXt およびビジョンTransformerアーキテクチャの両方のための、TAdaConvと効率的な時間的特徴集約を統合した拡張された基本ブロックである。
  • TAdaConvV2 は、キャリブレーション機構の最適化と、より効果的な注意ベースのグローバル文脈エンコーダーの導入により、元の TAdaConv を改善している。
  • TAdaConvNeXtV2 および TAdaFormer は、ImageNet での事前学習と、さらに Kinetics-710 での事後学習により、ゼロショットおよびフェイワショット性能を向上させている。
  • 本手法はドロップインリプレースメントとして設計されており、事前学習済み重みを保持し、再学習を必要とせずに動画タスクへの効率的適応を可能にしている。

実験結果

リサーチクエスチョン

  • RQ1固定重み畳み込みと比較して、時間軸に沿ったカスタムカーネルキャリブレーションは、動画理解の効率性と正確性を向上させることができるか?
  • RQ2カーネルレベルの適応機構は、事前学習済み重みを保持しつつ、動画モデルにおける強力な時間的モデリングを可能にするか?
  • RQ3計算コストとパフォーマンスの観点から、TAdaConv は標準的な1次元時間畳み込みや他の動的フィルタリング手法と比べてどのように差をつけるか?
  • RQ4TAdaConv は、アクション認識および局所化タスクにおいて、畳み込み型およびTransformerベースの動画モデルをどれほど向上させられるか?
  • RQ5大規模な事前学習および事後事前学習は、下流の動画ベンチマークにおける TAda ベースモデルのゼロショット一般化性能をさらに向上させるか?

主な発見

  • 32フレームで動作する TAdaConvNeXtV2-S は、Kinetics-400 で Swin-B よりも1.3%高い性能を示し、計算量はわずか57%に抑えられ、高い効率性と正確性を実証した。
  • TAdaConvNeXt-B は、類似した事前学習条件のもとで、Something-Something-V1 および V2 においてそれぞれ TDN-R101 よりも3.9%および2.9%高い正確性を達成した。
  • TAdaFormer-L/14 は、SSV1 および SSV2 においてそれぞれ UniFormerV2-L/14 よりも0.8%および0.5%高い性能を示し、時間的モデリングタスクにおける強力な性能を示した。
  • TAdaFormer-B/16 は、微調整済みの CLIP ViFi-CLIP よりもUCF101およびHMDB51で優れたゼロショット正確性を達成し、モデルスケーリングおよび事後事前学習によりさらなる向上が得られた。
  • HACS および Epic-Kitchens-100 において、TAdaConvNeXtV2 および TAdaFormer は、アクション局所化のための強力な特徴を生成し、BMN ベースラインを上回り、ViViT や SlowFast と同等の結果を達成した。
  • TAdaConvNeXtV2 および TAdaFormer は、より大きなモデルサイズおよび大規模な事前学習(Kinetics-710 での事後事前学習を含む)により、強力なスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。