Skip to main content
QUICK REVIEW

[論文レビュー] A3D: Adaptive 3D Networks for Video Action Recognition

Sijie Zhu, Taojiannan Yang|arXiv (Cornell University)|Nov 24, 2020
Human Pose and Action Recognition参考文献 46被引用数 10
ひとこと要約

A3Dは、複数の空間的・時間的・幅の設定を同時に学習することで、推論時の計算制約に応じて動的に適応する1つのアダプティブ3Dネットワークを導入する。空間的・時間的 distillation を通じて、異なる設定間での知識伝達を可能にし、同じ計算予算下で独立に学習されたモデルよりも優れた精度を達成する。特にKinetics-400における低計算量設定では顕著な性能向上を示す。

ABSTRACT

This paper presents A3D, an adaptive 3D network that can infer at a wide range of computational constraints with one-time training. Instead of training multiple models in a grid-search manner, it generates good configurations by trading off between network width and spatio-temporal resolution. Furthermore, the computation cost can be adapted after the model is deployed to meet variable constraints, for example, on edge devices. Even under the same computational constraints, the performance of our adaptive networks can be significantly boosted over the baseline counterparts by the mutual training along three dimensions. When a multiple pathway framework, e.g. SlowFast, is adopted, our adaptive method encourages a better trade-off between pathways than manual designs. Extensive experiments on the Kinetics dataset show the effectiveness of the proposed framework. The performance gain is also verified to transfer well between datasets and tasks. Code will be made available.

研究の動機と目的

  • 変動する計算制約を持つリソース制限の厳しいエッジデバイスに、3D動画行動認識モデルを効果的にデプロイする課題に対処すること。
  • 異なる計算制約に応じて複数の別個のモデルをトレーニングおよびデプロイする必要を排除すること。
  • マルチスケール学習を通じた相互知識学習を可能にすることで、すべての設定においてモデル性能を向上させること。
  • 再トレーニングなしに推論時に動的に適応可能であり、エッジデバイスにおけるリアルタイムデプロイメントを支援すること。
  • 下流タスクへの表現の転送性と、異種データセット間での一般化性能を示すこと。

提案手法

  • 各トレーニングイテレーションで、入力の空間的解像度、時間的持続時間、ネットワーク幅の多様な組み合わせをランダムにサンプリングして、1つのA3Dモデルをトレーニングする。
  • 高解像度設定から低解像度設定へと知識を伝達するための空間的・時間的蒸留(STD)を導入し、スケール間での特徴学習を強化する。
  • フル解像度ネットワークを主ブランチとして維持し、その表現を空間的および時間的に入力が減少したサブネットワークに蒸留する。
  • SlowFastを含む複数のアーキテクチャにこのフレームワークを適用し、手動設計なしにパスウェイのトレードオフを改善する。
  • グリッドサーチ手法と比較してトレーニングコストを低減する、統一されたトレーニングパラダイムを採用し、全設定でエンドツーエンド最適化を可能にする。
  • 同じモデルから任意の設定でランタイム推論が可能であり、変化するハードウェア制約に動的に適応できる。

実験結果

リサーチクエスチョン

  • RQ1再トレーニングなしに、幅広い計算予算範囲で効果的な精度-効率トレードオフを達成できる1つの3D動画認識モデルは可能か?
  • RQ2複数の空間的・時間的・幅設定を同時に学習することで、各設定を独立に学習する場合と比較して性能が向上するか?
  • RQ3異なる解像度間での知識蒸留は、低計算量設定における特徴表現を向上させることができるか?
  • RQ4X3D や SlowFast と比較して、A3D は精度、効率、デプロイメントの柔軟性において優れているか?
  • RQ5A3D が学習した表現は、他のデータセットやタスク(例:行動検出)へどの程度一般化可能か?

主な発見

  • A3Dは、SlowFast-4×16と同一の36.1 GFLOPs × 30ビューの制約下でKinetics-400でトップ1精度75.7%を達成し、ベースラインのSlowFast-4×16-P(75.6%)および独立に学習されたA3D-Slow-8×8-[0.06,1](75.6%)を上回る。
  • 低計算量設定(例:元の計算量の0.35倍)では、A3D-SlowFast-4×16-[0.06,1]が12.4 GFLOPs × 30ビューでトップ1精度74.3%を達成し、同じ計算レベルでの再現されたSlowFast-2×32-P(73.5%)を顕著に上回る。
  • 0.6倍の計算量(21.3 GFLOPs × 30ビュー)でも、A3D-SlowFast-4×16-[0.06,1]はトップ1精度75.0%を維持するが、ベースラインのSlowFast-2×32-Pは73.5%に低下する。
  • A3D-Slow-8×8-[0.06,1]はトップ1精度75.6%を達成し、独立に学習されたSlow-8×8-P(74.8%)およびマルチスケールベースライン(73.4%)を上回る。
  • 相互学習と蒸留による性能向上は、特に計算量が少ない環境で顕著であり、A3Dは独立に学習されたモデルと比較して最大1.1%の精度向上を達成する。
  • Charade-STAおよびAVAデータセットにおける転送結果から、A3Dが学習した表現はデータセットやタスク間で良好に一般化されることを確認し、学習済み特徴の強固さを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。