Skip to main content
QUICK REVIEW

[論文レビュー] Listen to Look: Action Recognition by Previewing Audio

Ruohan Gao, Tae-Hyun Oh|arXiv (Cornell University)|Dec 10, 2019
Human Pose and Action Recognition参考文献 88被引用数 10
ひとこと要約

本稿では、長時間のトリムされていない動画における効率的なアクション認識を可能にする、新たなフレームワーク「Listen to Look」を提案する。音声を軽量なプレビューとして用いることで、クリップレベルの特徴を蒸留し、アテンションベースのLSTMを用いた動画スキャンを行う。この手法により、性能を損なわず短期的・長期的両方の時間的冗長性を低減し、最先端の精度と速度を達成する。

ABSTRACT

In the face of the video data deluge, today's expensive clip-level classifiers are increasingly impractical. We propose a framework for efficient action recognition in untrimmed video that uses audio as a preview mechanism to eliminate both short-term and long-term visual redundancies. First, we devise an ImgAud2Vid framework that hallucinates clip-level features by distilling from lighter modalities---a single frame and its accompanying audio---reducing short-term temporal redundancy for efficient clip-level recognition. Second, building on ImgAud2Vid, we further propose ImgAud-Skimming, an attention-based long short-term memory network that iteratively selects useful moments in untrimmed videos, reducing long-term temporal redundancy for efficient video-level recognition. Extensive experiments on four action recognition datasets demonstrate that our method achieves the state-of-the-art in terms of both recognition accuracy and speed.

研究の動機と目的

  • 長時間のトリムされていない動画における、クリップレベルのアクション認識の計算非効率性を解消すること。
  • クリップレベルの処理を軽量な画像-音声特徴蒸留に置き換えることで、短期的冗長性を低減すること。
  • 音声をガイドとして用いることで、トリムされていない動画内の重要な瞬間を学習的に選択し、長期的冗長性を低減すること。
  • 動画アクション認識における、最先端の精度-速度トレードオフを達成すること。
  • 音声が、アクション認識における視覚的コンテンツの効果的で効率的なプレビューとして機能できることを示すこと。

提案手法

  • ImgAud2Vidフレームワークは、知識蒸留を用いて、1枚の画像とその対応する音声からクリップレベルの特徴を生成し、高コストな3D CNNの代わりに使用する。
  • 本手法は、フルクリップ上の強力な教師ネットワークの予測を模倣するように、画像-音声ペア上で軽量な学生ネットワークを訓練する。
  • ImgAud-Skimmingネットワークは、アテンションベースのLSTMを用いて、トリムされていない動画から最も情報量の多い画像-音声ペアを段階的に選択する。
  • スキャンモジュールは、画像-音声ペアから導出されたインデキシング特徴量を処理し、無関係なセグメントをスキップすることで、効率的な動画レベル認識を可能にする。
  • 音声は時間的ダイナミクスと文脈的手がかりの代理として用いられ、アクションの開始・終了を検出可能にする。
  • フレームワークは微分可能なアテンションを用いてエンドツーエンドに訓練され、特徴抽出と瞬間選択の共同最適化が可能になる。

実験結果

リサーチクエスチョン

  • RQ1音声は、動画アクション認識における冗長処理を低減するための効率的なプレビューとして利用可能か?
  • RQ2蒸留された画像-音声特徴は、フルクリップレベル特徴と同等の性能を達成しつつ、著しく効率的か?
  • RQ3音声および画像特徴でガイドされたアテンションベースの動画スキャン機構は、均等サンプリングや密度推論を上回る性能を示せるか?
  • RQ4クリップレベルおよび動画レベルの処理において音声を活用することで、より良い精度-速度トレードオフが達成できるか?
  • RQ5提案手法は、動画長やアクションの希疎性が異なる多様なアクション認識データセットに一般化可能か?

主な発見

  • ResNet-152特徴を用いたActivityNetでは、84.2のmAPを達成し、先行手法を0.4ポイント上回る最先端の性能を示した。
  • R(2+1)D-152特徴を用いた場合、89.9%のmAPを達成し、密度推論の10倍、均等サンプリングの20倍の高速化を実現した。
  • ActivityNetでは、計算コストを1.31 TFLOPs(密度推論の25.9に比べ)にまで低減しながら、高い精度を維持した。
  • 定性的な結果から、ImgAud-Skimmingが選択したフレームは、均等にサンプリングされたフレームよりもはるかにアクションを的確に示していることが明らかになった。
  • アーチェリー、トライプルジャンプ、ビアポングといった、瞬間的で希少なアクションにおいて、最高の精度向上を達成した。
  • アブレーションスタディにより、ImgAud2Vidの蒸留ステップが、軽量な認識特徴を用いても顕著な精度向上に寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。