Skip to main content
QUICK REVIEW

[論文レビュー] Collaborative Distillation in the Parameter and Spectrum Domains for Video Action Recognition

Haisheng Su, Jing Su|arXiv (Cornell University)|Sep 15, 2020
Human Pose and Action Recognition参考文献 32被引用数 9
ひとこと要約

本論文は、動画行動認識のための新しい知識蒸留フレームワークである特徴量およびパラメータ共同蒸留(FPCD)を提案する。FPCDは、特徴量の時間的周波数スペクトルとパラメータ分布を周波数ドメインで活用し、軽量な学生ネットワークを訓練する。教師ネットワークから動きのダイナミクスと外観モデリングの両方の知識を共同で蒸留することで、Kinetics、Something-Something、Jesterの各ベンチマークで最先端の性能を達成し、モデルサイズと計算量を顕著に削減した。

ABSTRACT

Recent years have witnessed the significant progress of action recognition task with deep networks. However, most of current video networks require large memory and computational resources, which hinders their applications in practice. Existing knowledge distillation methods are limited to the image-level spatial domain, ignoring the temporal and frequency information which provide structural knowledge and are important for video analysis. This paper explores how to train small and efficient networks for action recognition. Specifically, we propose two distillation strategies in the frequency domain, namely the feature spectrum and parameter distribution distillations respectively. Our insight is that appealing performance of action recognition requires extit{explicitly} modeling the temporal frequency spectrum of video features. Therefore, we introduce a spectrum loss that enforces the student network to mimic the temporal frequency spectrum from the teacher network, instead of extit{implicitly} distilling features as many previous works. Second, the parameter frequency distribution is further adopted to guide the student network to learn the appearance modeling process from the teacher. Besides, a collaborative learning strategy is presented to optimize the training process from a probabilistic view. Extensive experiments are conducted on several action recognition benchmarks, such as Kinetics, Something-Something, and Jester, which consistently verify effectiveness of our approach, and demonstrate that our method can achieve higher performance than state-of-the-art methods with the same backbone.

研究の動機と目的

  • リソースが限られた実世界の応用において、大規模で計算コストの高い動画行動認識モデルを導入する課題に対処すること。
  • 従来の知識蒸留手法が空間的特徴にのみ注目し、動画における時間的および周波数ドメインの構造的知識を無視するという制限を克服すること。
  • 周波数ドメインでの知識を明示的にモデル化することで、時間的ダイナミクスと外観表現を捉えることにより、軽量な学生ネットワークの性能を向上させること。
  • 蒸留過程で冗長な知識を動的に削除する共同学習戦略を開発し、より効率的な訓練を実現すること。
  • Kinetics、Something-Something、Jesterを含む多様な動画アーキテクチャとベンチマークにおいて汎用性を示すこと。

提案手法

  • 教師ネットワークの動画特徴量の時間的周波数スペクトルを模倣するよう学生ネットワークを促すスペクトル損失を導入し、動きとシーンレベルの表現を捉える。
  • 畳み込み層の重みの周波数ドメイン分布を一致させることで、教師の構造的知識をパラメータ分布蒸留により転送する。
  • 確率的観点から最適化する共同学習戦略を定式化し、教師から冗長な知識を適応的に抑制する。
  • スペクトル損失、パラメータ蒸留損失、および標準的な交差エントロピー分類損失を統合した訓練目的関数を構築する。
  • さまざまな動画バックボーンアーキテクチャ(例:STM、I3D、TSN)とデータセットにフレームワークを適用し、汎用性と効率性を評価する。
  • フーリエ変換を用いて特徴量およびパラメータの周波数スペクトルを分析・比較し、動画理解における低周波数成分と高周波数成分の重要性を検証する。

実験結果

リサーチクエスチョン

  • RQ1動画特徴量の時間的周波数スペクトルを蒸留することで、軽量な学生ネットワークにおける行動認識性能が向上するか?
  • RQ2ネットワークパラメータの周波数分布をモデル化することで、学生が教師から外観モデリングを学ぶ能力が向上するか?
  • RQ3共同学習が、冗長な知識を排除することで知識蒸留の効率をどのように向上させるか?
  • RQ4提案手法は、異なる動画アーキテクチャとデータセットにどの程度汎用性を示すか?
  • RQ5異なる種類の動画データセット(例:シーン関連 vs. 動作関連)において、低周波数成分と高周波数成分のどちらが性能向上に寄与しているか?

主な発見

  • Kinetics-400では、FPCDが学生用のSTM-ResNet18を用いて71.1%のトップ-1正解率を達成し、ベースラインのSimple KDおよびCCKD手法を上回り、より深い教師のResNet-50に近づいた。
  • Something-Something V1では、FPCDがチャネル半分のI3Dバックボーンを用いて39.1%のトップ-1正解率を達成し、Simple KD(37.4%)およびCCKD(38.0%)をそれぞれ1.7%および1.1%上回った。
  • Kinetics-400において、低周波数特徴スペクトルの蒸留は高周波数蒸留よりも1.3%の性能向上をもたらし、シーンの外観モデリングにおいてその重要性を裏付けた。
  • パラメータ分布蒸留は、Kinetics-400のようなシーン関連のデータセットにおいて、特徴スペクトル蒸留よりも大きな向上をもたらした。これは、空間的外観の手がかりを捉える有効性を示している。
  • 共同学習戦略により、冗長な知識の動的削除が可能となり、さまざまなフレームワークにおいて蒸留の効率と性能の一貫性が向上した。
  • FPCDはアーキテクチャにわたって良好に汎用化された:TSN-ResNet18ではJesterおよびSomething-Something V2で教師のResNet-50を上回り、すべてのデータセットで軽量なInception V1(チャネル半分)において一貫した性能向上を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。