Skip to main content
QUICK REVIEW

[論文レビュー] Attention Distillation for Learning Video Representations

Miao Liu, Xin Chen|arXiv (Cornell University)|Apr 5, 2019
Human Pose and Action Recognition参考文献 17被引用数 6
ひとこと要約

本論文では、RGBフレームから動きに敏感な動画表現を学ぶために、流れネットワークからRGBネットワークへの注目マップの転送を用いた注目蒸留を提案する。この手法は、計算コストをほとんど増加させることなく、UCF101、HMDB51、EGTEA、20BN-V2ベンチマークで一貫して+1%の精度向上を達成し、動画認識における知識蒸留の強固な媒体としての注目度の有効性を示している。

ABSTRACT

We address the challenging problem of learning motion representations using deep models for video recognition. To this end, we make use of attention modules that learn to highlight regions in the video and aggregate features for recognition. Specifically, we propose to leverage output attention maps as a vehicle to transfer the learned representation from a motion (flow) network to an RGB network. We systematically study the design of attention modules, and develop a novel method for attention distillation. Our method is evaluated on major action benchmarks, and consistently improves the performance of the baseline RGB network by a significant margin. Moreover, we demonstrate that our attention maps can leverage motion cues in learning to identify the location of actions in video frames. We believe our method provides a step towards learning motion-aware representations in deep models. Our project page is available at https://aptx4869lm.github.io/AttentionDistillation/

研究の動機と目的

  • RGBフレームのみを用いた動画モデルで、明示的な流れ計算を伴わずに動きに敏感な表現を学ぶという課題に対処すること。
  • 追加の推論コストを負担せずに、単一ストリームRGBネットワークと二ストリームモデル(RGB + 流れ)の性能差を埋めること。
  • 注目マップが動画認識における知識蒸留の強固でタスクに敏感な媒体として機能できるかどうかを検討すること。
  • 単一ストリームRGBネットワークで外観と動きの両方の表現を保持する手法を開発すること。
  • 複数の標準的な動画行動認識ベンチマークにおいて、注目蒸留の有効性を評価すること。

提案手法

  • 本手法は、事前に訓練された流れネットワークの注目マップを模倣することで、RGBフレームから動きに敏感な注目マップを生成する確率的注目モジュール(Prob-Atten)を用いる。
  • 注目蒸留は、トレーニング中にRGBネットワークの注目マップと参照用の流れネットワークの注目マップの間のL2損失を最小化することで、知識を転送する。
  • 蒸留されたRGBモデルは、推論時にRGB入力のみを用いて、外観と動きの両方の注目マップを同時に予測する。
  • 本手法は、注目マップの空間的・時間的不変性を活用し、明示的なオプティカルフロー計算なしに動きの手がかりを符号化する。
  • 滑らかでより強固な注目特徴を生成するために、一様分布を用いた正則化項を注目マップに適用する。
  • 本手法は、複数のデータセットで標準的なI3DおよびResNeXtバックボーンを用いて評価され、注目モジュール設計に関するアブレーションスタディが実施されている。

実験結果

リサーチクエスチョン

  • RQ1流れネットワークの注目マップが、RGBネットワークに効果的に動きの知識を転送できるか?
  • RQ2注目蒸留は、動きに敏感な表現を学ぶ際、従来の特徴蒸留を上回る性能を発揮するか?
  • RQ3注目蒸留を用いることで、単一ストリームRGBモデルが二ストリームモデルに近い性能を達成できるか?
  • RQ4異なる注目モジュール設計が、認識精度および耐性に与える影響は何か?
  • RQ5蒸留は元のRGB特徴を上書きするのか、それとも意味のある外観表現を保持できるのか?

主な発見

  • 提案された注目蒸留手法は、UCF101、HMDB51、EGTEA、20BN-V2データセットにおいて、ベースラインRGBネットワークの精度を約+1%向上させる。
  • I3D Flowという弱い教師モデルですら、Prob-DistillがUCF101で49.5%の精度を達成し、RGBのみ(49.1%)および流れのみ(40.4%)の注目ベースI3Dモデルを上回る。
  • 参照の流れネットワーク(Flow I3D)と蒸留されたRGBモデルを統合した(Prob-Distill + Flow I3D)場合、UCF101で0.5%、HMDB51で0.7%、20BN-V2で0.9%向上し、二ストリームI3Dモデルを上回る。
  • 蒸留されたモデルの注目マップは、標準的なソフト注目メカニズムとは質的に異なり、外観注目はフォアグラウンドのアクターをよりよく局所化し、動き注目は動いている部分に集中する。
  • 蒸留が元のRGBストリーム表現を上書きしないことが実証されており、流れストリームと統合した際の性能向上から、意味のある外観特徴が保持されていることが示されている。
  • 可視化により、正則化のおかげで注目マップがより広がった、明確に異なる形状をとることで、キーモーメント領域を局所化し、耐性が向上していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。