Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Sequence Distillation: Towards Few-Frame Action Recognition in Videos

Zhaoyang Zhang, Zhanghui Kuang|arXiv (Cornell University)|Aug 15, 2018
Human Pose and Action Recognition参考文献 22被引用数 4
ひとこと要約

本稿では、エンドツーエンドの3次元畳み込みニューラルネットワーク(3D CNN)学習を用いて、長時間の動画シーケンスをコンパクトで代表的な短いシーケンスに蒸留する手法、時系列蒸留(Temporal Sequence Distillation; TSD)を提案する。TSDは、判別性のある空間時間的特徴を学習することで、50%のフレーム送信削減とクラウド上のFLOPsの50%削減を実現しながら、KineticsおよびUCF101データセットで最先端の精度を維持した、少数フレームでのアクション認識を可能にする。

ABSTRACT

Video Analytics Software as a Service (VA SaaS) has been rapidly growing in recent years. VA SaaS is typically accessed by users using a lightweight client. Because the transmission bandwidth between the client and cloud is usually limited and expensive, it brings great benefits to design cloud video analysis algorithms with a limited data transmission requirement. Although considerable research has been devoted to video analysis, to our best knowledge, little of them has paid attention to the transmission bandwidth limitation in SaaS. As the first attempt in this direction, this work introduces a problem of few-frame action recognition, which aims at maintaining high recognition accuracy, when accessing only a few frames during both training and test. Unlike previous work that processed dense frames, we present Temporal Sequence Distillation (TSD), which distills a long video sequence into a very short one for transmission. By end-to-end training with 3D CNNs for video action recognition, TSD learns a compact and discriminative temporal and spatial representation of video frames. On Kinetics dataset, TSD+I3D typically requires only 50\% of the number of frames compared to I3D, a state-of-the-art video action recognition algorithm, to achieve almost the same accuracies. The proposed TSD has three appealing advantages. Firstly, TSD has a lightweight architecture and can be deployed in the client, eg. mobile devices, to produce compressed representative frames to save transmission bandwidth. Secondly, TSD significantly reduces the computations to run video action recognition with compressed frames on the cloud, while maintaining high recognition accuracies. Thirdly, TSD can be plugged in as a preprocessing module of any existing 3D CNNs. Extensive experiments show the effectiveness and characteristics of TSD.

研究の動機と目的

  • 動画分析サービス(VA SaaS)における帯域幅と計算コストを低減するため、最小限のフレーム送信で高精度なアクション認識を実現すること。
  • 長時間の入力動画から、判別性のある時間的および空間的特徴を保持した、コンパクトで代表的な動画シーケンスを学習する手法を開発すること。
  • 軽量クライアント(例:モバイルデバイス)にデプロイ可能な蒸留モデルを可能にし、データ送信量とサーバーサイドの計算負荷を削減すること。
  • 送信されるフレーム数が非常に少ない状況でも、高い認識精度を維持できること。
  • 既存の3D CNN(例:I3D)と互換性があり、実世界のVA SaaSパイプラインへの効率的な統合が可能なプラグイン型前処理モジュールを提供すること。

提案手法

  • TSDは、3D CNNバックボーン(例:I3D)を用いたエンドツーエンドのトレーニングパイプラインを採用し、長時間の動画シーケンスを短く代表的なシーケンスに圧縮する学習を可能にする。
  • 本手法は、粗い特徴抽出部と時系列蒸留ブロックを備えており、これらが共同でアクションクラスに関連する重要なフレームを特定する学習を実施する。
  • TSDは知識蒸留を用いてトレーニングされ、フルクリップの3D CNNの出力を、フレームのサブセットのみを用いて再現することを学習する。
  • 蒸留プロセスは、アクション関連のフレームに注目することで、時間的ダイナミクスと空間的文脈を保持し、冗長性を低減しながらも判別力を維持する。
  • フレームワークはモジュラーであり、任意の3D CNNの前処理ステップとして挿入可能で、既存モデルとの互換性を確保する。
  • 推論時、クライアントはTSDを実行してコンパクトなフレームシーケンスを生成し、それをクラウドに送信して最終的な分類を実行する。

実験結果

リサーチクエスチョン

  • RQ1最小限のフレーム送信で高精度なアクション認識を維持できる、コンパクトで代表的な動画シーケンスをエンドツーエンドで学習可能か?
  • RQ2標準ベンチマーク上での精度と効率性の観点から、TSDは均一サンプリングや他のフレーム選択戦略と比較してどのように優れているか?
  • RQ3VA SaaSシナリオにおいて、認識性能を損なわずにTSDがどれほどデータ送信量と計算コストを削減できるか?
  • RQ4TSDはクライアント側デバイスに効果的にデプロイ可能であり、I3Dのような既存の3D CNNと統合可能か?
  • RQ5異なるデータセットやモデル構成において、フレーム削減、計算コストの削減、精度のトレードオフはどのように変化するか?

主な発見

  • Kineticsデータセットでは、I3D+TSDはわずか120フレームの送信で72.4%の精度を達成した。これはI3Dの250フレームに比べて50%の削減であり、性能は同等を維持した。
  • フレーム送信を60フレームに削減した場合、I3D+TSDは70.7%の精度を達成した。これは、40フレーム送信時のベースラインI3D(68.4%)を上回り、クラウド上のFLOPsを51%も削減した。
  • UCF101では、5フレームのみをサンプリングした場合、I3D+TSDはI3Dよりも7.7%の精度向上を示し、少数フレーム環境下での優れた性能を示した。
  • I3Dに比べ、モデルパラメータが33%増加したにもかかわらず、TSDはクラウド側のFLOPsを最大50%、推論時間を最大48%削減した。
  • 異なるクリップ数やフレームサンプリングレートにおいても、一貫した性能向上を示し、頑健性とスケーラビリティを兼ね備えている。
  • TSDのクライアント側デプロイにより、送信帯域幅とクラウド計算負荷が削減され、リアルタイムのVA SaaSアプリケーションに非常に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。