[論文レビュー] MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning
MorphMLPは、自己注意機構を排除し、MLPに類似したバックボーンを提案する。2つの特化した全結合層—空間的モデリングに適したMorphFC_sと、時間的依存性学習に適したMorphFC_t—を用い、計算量を大幅に削減しながら最先端の精度を達成し、VideoSwin や MViT と同等のFLOP予算下で優れた性能を発揮する。
Recently, MLP-Like networks have been revived for image recognition. However, whether it is possible to build a generic MLP-Like architecture on video domain has not been explored, due to complex spatial-temporal modeling with large computation burden. To fill this gap, we present an efficient self-attention free backbone, namely MorphMLP, which flexibly leverages the concise Fully-Connected (FC) layer for video representation learning. Specifically, a MorphMLP block consists of two key layers in sequence, i.e., MorphFC_s and MorphFC_t, for spatial and temporal modeling respectively. MorphFC_s can effectively capture core semantics in each frame, by progressive token interaction along both height and width dimensions. Alternatively, MorphFC_t can adaptively learn long-term dependency over frames, by temporal token aggregation on each spatial location. With such multi-dimension and multi-scale factorization, our MorphMLP block can achieve a great accuracy-computation balance. Finally, we evaluate our MorphMLP on a number of popular video benchmarks. Compared with the recent state-of-the-art models, MorphMLP significantly reduces computation but with better accuracy, e.g., MorphMLP-S only uses 50% GFLOPs of VideoSwin-T but achieves 0.9% top-1 improvement on Kinetics400, under ImageNet1K pretraining. MorphMLP-B only uses 43% GFLOPs of MViT-B but achieves 2.4% top-1 improvement on SSV2, even though MorphMLP-B is pretrained on ImageNet1K while MViT-B is pretrained on Kinetics400. Moreover, our method adapted to the image domain outperforms previous SOTA MLP-Like architectures. Code is available at https://github.com/MTLab/MorphMLP.
研究の動機と目的
- 自己注意機構に依存しないMLPに類似したアーキテクチャが、動画表現学習に効果的に拡張可能かどうかを検討すること。
- 自己注意機構に依存せずに、階層的な空間的意味を捉える課題に対処すること。
- 最小限の計算コストで長距離の時間的依存性を捉える効率的な時間モデリング機構を設計すること。
- 既存のビジョントランスフォーマーやCNNと比較して、動画分類における精度と計算量のトレードオフを優れたものにすること。
- 提案されたアーキテクチャが、画像認識およびセマンティックセグメンテーションタスクへの一般化性能を検証すること。
提案手法
- MorphMLPは、2つの連続するコンponent—空間モデリング用のMorphFC_sと時間モデリング用のMorphFC_t—から成る新しいブロックアーキテクチャを採用する。
- MorphFC_sは、高さおよび幅方向に段階的なトークン相互作用を通じて受容 field を徐々に拡大し、マルチスケールの空間的特徴を学習可能にする。
- MorphFC_tは、各空間的位置で全フレームの特徴を集約して時間的チャンクを作成し、その後、全結合層を用いて長距離の時間的依存性をモデル化する。
- 空間的および時間的モジュールを逐次スタックして深さのあるMorphMLPバックボーンを構築し、空間モジュールの後にスキップ残差接続を適用して学習の安定化を図る。
- 自己注意機構を排除するため、因子化され、段階的かつ適応的な全結合演算を導入し、FLOPsを削減しながら表現力は維持する。
- 画像タスクに適応するため時間次元を除去し、ImageNet-1KおよびADE20Kで優れた性能を示す。
実験結果
リサーチクエスチョン
- RQ1自己注意機構を排除したMLPに類似したアーキテクチャが、動画データの空間的・時間的表現を効果的に学習できるか?
- RQ2空間モデリングにおける階層的かつ段階的なトークン相互作用は、グローバルMLPや畳み込み演算と比較して、特徴学習をどのように改善するか?
- RQ3全結合層は、計算コストを抑えながら、動画における長距離の時間的依存性を効果的に置き換えられるか?
- RQ4精度と効率のバランスを最適化するための最適なアーキテクチャ構成(例:処理順序、残差接続)は何か?
- RQ5時間次元を除去した場合、提案されたMorphMLPアーキテクチャは画像認識およびセグメンテーションタスクに十分に一般化できるか?
主な発見
- ImageNet1Kでの事前学習条件下で、MorphMLP-SはKinetics400でVideoSwin-Tに比べて0.9%高いトップ1精度を達成したが、GFLOPsは半分にまで削減された。
- MorphMLP-Bは、SSV2でMViT-Bに比べて2.4%高いトップ1精度を達成したが、GFLOPsは43%にまで削減され、Kinetics400での事前学習ではなくImageNet1Kでの事前学習が行われた。
- MorphFC_sは、標準的な3×3および7×7畳み込みに比べ、ImageNet-1Kで2.3–2.4%高いトップ1精度を達成し、長距離の空間的コンテキストを捉える優位性を示した。
- MorphFC_tは、SSV1で3×1×1および5×1×1時間的畳み込みに比べ顕著に優れており、トップ1精度50.6%を達成したのに対し、それぞれ47.9%および48.6%であった。
- MorphFC_sの後にMorphFC_tを順次適用し、スキップ残差接続を適用した構成が最も優れた性能を示し、並列処理や他の順序構成を上回った。
- 完全なMorphMLPモデルは、SlowFast や Timesformer と同等またはそれ以上の精度を達成しながら、GPU時間の観点からも訓練速度が速く、訓練コストが低かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。