[論文レビュー] Video Mobile-Former: Video Recognition with Efficient Global Spatial-temporal Modeling
Video Mobile-Former は、3D-CNN バックボーンによる局所的特徴抽出と、Transformer エンコーダー内での6つの可学習グローバルトークンに限定されたグローバルな空間時間モデリングを分離することで、軽量な動画認識モデルを提案する。これらのグローバルトークンと局所的特徴の間でクロスアテンションを用いることで、1G FLOPs未満の計算量で最先端の性能を達成し、低FLOP領域における効率的なCNNおよび大規模な動画Transformerを上回る性能を発揮する。
Transformer-based models have achieved top performance on major video recognition benchmarks. Benefiting from the self-attention mechanism, these models show stronger ability of modeling long-range dependencies compared to CNN-based models. However, significant computation overheads, resulted from the quadratic complexity of self-attention on top of a tremendous number of tokens, limit the use of existing video transformers in applications with limited resources like mobile devices. In this paper, we extend Mobile-Former to Video Mobile-Former, which decouples the video architecture into a lightweight 3D-CNNs for local context modeling and a Transformer modules for global interaction modeling in a parallel fashion. To avoid significant computational cost incurred by computing self-attention between the large number of local patches in videos, we propose to use very few global tokens (e.g., 6) for a whole video in Transformers to exchange information with 3D-CNNs with a cross-attention mechanism. Through efficient global spatial-temporal modeling, Video Mobile-Former significantly improves the video recognition performance of alternative lightweight baselines, and outperforms other efficient CNN-based models at the low FLOP regime from 500M to 6G total FLOPs on various video recognition tasks. It is worth noting that Video Mobile-Former is the first Transformer-based video model which constrains the computational budget within 1G FLOPs.
研究の動機と目的
- モバイルデバイスなどの厳しい計算制約下でも高い精度を維持できる動画認識モデルの設計。
- 標準的な動画Transformerの2次関数的計算量の複雑さを克服し、自己注意メカニズムが処理するトークン数を著しく削減すること。
- 3D-CNN(局所的なインダクティブバイアス)とTransformer(グローバルな長距離モデリング)の長所を統合した、軽量で効率的なアーキテクチャの構築。
- FLOPsとレイテンシを最小限に抑えることで、CPUおよびモバイルプラットフォームでのリアルタイム推論を可能にすること。
提案手法
- 本モデルは2本のブランチからなるアーキテクチャである:局所的コンテキストモデリングのための、軽量な3Dディープワイズおよびポイントワイズ畳み込みに基づく Mobile ブランチ。
- Former ブランチは、6つの可学習グローバルトークンに限定してマルチヘッド自己注意を適用し、動画全体のグローバルな空間時間的依存関係をモデリングする。
- グローバルトークンと局所的3D-CNN特徴の間で双方向の情報交換を可能にするために、クロスアテンション機構が用いられる。
- 時間的ダウンサンプリングは、畳み込みスタムにおける大きな時間的ストライドを用いてネットワークの初期段階で実施され、シーケンス長と計算コストを削減する。
- Mobile ブロックに動的ReLU活性化関数を導入し、フレームレベルの特徴を用いてチャネルごとのパラメータを生成することで、表現能力を向上させる。
- FLOPsが500M~6Gの低域で高い精度を維持できるようにアーキテクチャが設計されており、CPUおよびモバイルハードウェアにおける推論効率に重点を置いている。
実験結果
リサーチクエスチョン
- RQ1モバイルデプロイメントに適したほど効率的でありながら、強力な性能を維持できる動画Transformerは構築可能か?
- RQ2自己注意に6つのグローバルトークンしか使用しない場合でも、動画の長距離空間時間的依存関係を効果的にモデリングできるか?
- RQ33D-CNNと最小限のTransformerモジュールの組み合わせは、最先端の軽量CNNおよび完全な動画Transformerと比較して、精度とFLOPsの面で優れているか?
- RQ4軽量な動画モデルにおける時間的ダウンサンプリングの最適な配置と設計は何か?
- RQ5動的活性化関数は、パrameterが限られた動画認識モデルの性能向上に寄与するか?
主な発見
- Video Mobile-Former は、Kinetics-400で1G FLOPs未満の計算量で67.4%のトップ-1精度を達成し、同FLOP域の他のすべてのモデルを上回る性能を発揮した。
- V100 GPUでは29.0ms、CPUでは603.5msで実行可能であり、同等の動画Transformerよりも顕著に高速で、3D-CNNベースラインと同等の性能を発揮した。
- 6つのグローバルトークンのみを用いることで、より多くのトークンを使用する場合や、フレームごとに自己注意を適用する場合よりも優れた性能が得られ、グローバルトークン設計の有効性が裏付けられた。
- アブレーションスタディの結果、FLOPsがわずかに増加するものの、Mobileブロックにおける3Dディープワイズ畳み込みが2Dまたは(2+1)D畳み込みよりも優れた性能を発揮した。
- フレームレベルの特徴によるモodulationを施した動的ReLUは、ReLUよりも2.5ポイント、元のMobile-Former設計よりも1.8ポイントのトップ-1精度向上を達成した。
- ネットワークが浅くなるほど性能向上が顕著に現れ、浅い深さでも強力な性能を維持しており、軽量アーキテクチャにおける高い効率性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。