Skip to main content
QUICK REVIEW

[論文レビュー] 2D or not 2D? Adaptive 3D Convolution Selection for Efficient Video Recognition

Hengduo Li, Zuxuan Wu|arXiv (Cornell University)|Dec 29, 2020
Human Pose and Action Recognition参考文献 46被引用数 5
ひとこと要約

Ada3Dは、推論中にフレームおよび3D畳み込み層を動的に選択するインスタンス固有のポリシーを学習する条件付き計算フレームワークを提案する。これにより、動画認識ベンチマークで最先端の精度を維持したまま、計算コストを20%〜50%削減できる。軽量な二本のヘッドを備えた強化学習ベースの選択ネットワークを用いて、各入力クリップに対してどのフレームと3D畳み込み層を有効化するかを決定し、性能を損なわず効率的で適応的な推論を実現する。

ABSTRACT

3D convolutional networks are prevalent for video recognition. While achieving excellent recognition performance on standard benchmarks, they operate on a sequence of frames with 3D convolutions and thus are computationally demanding. Exploiting large variations among different videos, we introduce Ada3D, a conditional computation framework that learns instance-specific 3D usage policies to determine frames and convolution layers to be used in a 3D network. These policies are derived with a two-head lightweight selection network conditioned on each input video clip. Then, only frames and convolutions that are selected by the selection network are used in the 3D model to generate predictions. The selection network is optimized with policy gradient methods to maximize a reward that encourages making correct predictions with limited computation. We conduct experiments on three video recognition benchmarks and demonstrate that our method achieves similar accuracies to state-of-the-art 3D models while requiring 20%-50% less computation across different datasets. We also show that learned policies are transferable and Ada3D is compatible to different backbones and modern clip selection approaches. Our qualitative analysis indicates that our method allocates fewer 3D convolutions and frames for "static" inputs, yet uses more for motion-intensive clips.

研究の動機と目的

  • 動画認識における3D畳み込みネットワークの高い計算コストを低減すること。これは、動画の複雑さにかかわらず、すべてのフレームと層を均等に処理するためのものである。
  • 固定された3D推論の非効率性に対処し、入力に依存するフレームおよび3D畳み込み層の動的選択を可能にすること。
  • 各動画クリップに対して、いつどれだけの計算量を使うかを学習する軽量でエンドツーエンドで訓練可能なフレームワークを開発し、精度を損なわず効率を向上させること。
  • 学習された選択ポリシーが異なるデータセットに一般化可能であることを示すこと。また、さまざまな3Dバックボーンおよびクリップ選択手法と互換性があること。

提案手法

  • ポリシー勾配法を用いて訓練される、軽量な二本のヘッド選択ネットワークが、各入力動画クリップに対してフレーム使用および3D畳み込み使用ポリシーを生成する。
  • 選択ネットワークは、入力クリップの内容に基づいて、フレームおよび3D畳み込み層のバイナリ意思決定(保持/破棄)を出力し、事前に学習済みの3Dモデルにおける動的推論を可能にする。
  • 報酬関数は、分類精度を最大化するとともに計算コストを最小化することを目的として設計されており、効率的なリソース配分を促進する。
  • 選択ネットワークはまず固定された3Dモデルで事前学習され、その後、3Dバックボーンと共同で微調整され、適応的推論のパラダイムに適応する。
  • ポリシーのデータセット間での転送性をサポートしており、例としてMini-Kinetics-200からKineticsへの転送が可能である。
  • 本手法はさまざまな3Dバックボーンと互換性があり、既存のクリップレベル選択戦略とも相乗効果を発揮する。

実験結果

リサーチクエスチョン

  • RQ1フレームおよび3D畳み込み層の適応的選択は、精度を劣化させることなく計算コストを低減できるか?
  • RQ2強化学習ベースのポリシー勾配フレームワークは、インスタンス固有の3D推論戦略を学習するのにどの程度効果的か?
  • RQ3学習された選択ポリシーは、異なる動画データセットおよび3Dモデルアーキテクチャ間で一般化可能か?
  • RQ4フレーム使用ポリシーと3D畳み込み使用ポリシーが、性能および効率にどのように共同で寄与するか?
  • RQ5提案手法は、既存のクリップ選択および軽量3Dバックボーンアプローチと互換性があるか?

主な発見

  • Ada3Dは、ActivityNet、FCVID、Mini-Kinetics-200の3つのベンチマークで、最先端の3Dモデルと同等の精度を維持しながら、計算量を20%〜50%削減した。
  • Slowonlyバックボーンを用いたFCVIDでは、計算量を58.6 GFLOPsから35.6 GFLOPsに削減(38.6%の削減)し、mAPはわずか0.3%低下にとどまった。
  • ActivityNetでは、計算量を58.6 GFLOPsから42.2 GFLOPsに削減(28%の削減)し、mAPは76.1%を維持した。
  • 選択ネットワークと3Dモデルの共同微調整により、FCVIDにおけるmAPが75.9から77.8に向上し、適応化の重要性が示された。
  • フレームと3D畳み込み使用ポリシーを同時に学習する二本のヘッドアーキテクチャは、単一のコンponentポリシーに比べてmAPを1%向上させ、協調学習の有効性を示した。
  • 定性的な分析から、Ada3Dは動きの激しいクリップ(例:ブレイクダンス、太極拳)に対してより多くの計算を割り当て、静的で動きの少ないクリップ(例:本の製本、コートシーン)に対してはリソースを削減することが確認され、直感的な効率性の期待と整合した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。