Skip to main content
QUICK REVIEW

[論文レビュー] Single Image Action Recognition by Predicting Space-Time Saliency

Marjaneh Safaei, Hassan Foroosh|arXiv (Cornell University)|May 12, 2017
Visual Attention and Saliency Detection参考文献 80被引用数 4
ひとこと要約

本論文では、1枚の画像から未来の動き(光流)と局所的顕著性マップを予測することで、欠落した時間的情報を回復する、深層学習の新規アプローチを提案する。画像を予測光流-顕著性マップ(POF-SM)ドメインにマッピングし、事前学習済みの畳み込みニューラルネットワーク(CNN)を微調整することで、200万枚以上の画像を含む新しい大規模なUCF Still Imageデータセット(UCFSI-101)およびWillowデータセットの両方で最先端の性能を達成した。

ABSTRACT

We propose a novel approach based on deep Convolutional Neural Networks (CNN) to recognize human actions in still images by predicting the future motion, and detecting the shape and location of the salient parts of the image. We make the following major contributions to this important area of research: (i) We use the predicted future motion in the static image (Walker et al., 2015) as a means of compensating for the missing temporal information, while using the saliency map to represent the the spatial information in the form of location and shape of what is predicted as significant. (ii) We cast action classification in static images as a domain adaptation problem by transfer learning. We first map the input static image to a new domain that we refer to as the Predicted Optical Flow-Saliency Map domain (POF-SM), and then fine-tune the layers of a deep CNN model trained on classifying the ImageNet dataset to perform action classification in the POF-SM domain. (iii) We tested our method on the popular Willow dataset. But unlike existing methods, we also tested on a more realistic and challenging dataset of over 2M still images that we collected and labeled by taking random frames from the UCF-101 video dataset. We call our dataset the UCF Still Image dataset or UCFSI-101 in short. Our results outperform the state of the art.

研究の動機と目的

  • 時間的情報の欠落により生じる静止画像における行動認識の課題に対処すること。
  • 人間の知覚的能力を活用し、未来の動きと顕著な身体部位を行動認識の手がかりとして予測すること。
  • 新しいPOF-SM特徴空間を用いたドメイン適応により、限られた行動クラスデータセットにおける性能向上を図ること。
  • UCF-101の動画から抽出した200万枚の静止画像から構成される大規模で現実的であるデータセットを構築し、評価すること。
  • 予測された動きと空間的顕著性が、静止画像における行動認識に強力な判別的信号を提供することを示すこと。

提案手法

  • 本手法は、1枚の画像から密な光流を予測する事前学習済みモデル(Walker et al., 2015)を用いて、静止画像内の未来の動きを予測する。
  • 画像内の空間的に顕著な身体部位とその形状を特定するための顕著性マップを生成する。
  • 予測された光流と顕著性マップを組み合わせることで、入力画像を新しいドメイン、すなわち予測光流-顕著性マップ(POF-SM)ドメインに変換する。
  • ImageNetで事前学習済みのCNNをPOF-SMドメインで微調整し、ドメイン適応を活用した転移学習により行動分類を実行する。
  • UCF-101の動画から抽出した200万枚の静止画像から構成される大規模データセットを用い、元の動画から引き継いだ行動ラベルを保持する。
  • 一般化性能と頑健性を検証するため、標準的なWillowデータセットと新たに導入されたUCFSI-101データセットの両方で評価を実施する。

実験結果

リサーチクエスチョン

  • RQ11枚の画像における予測された未来の動きと空間的顕著性が、正確な行動認識に十分な手がかりを提供できるか?
  • RQ2静止画像をPOF-SMドメインにマッピングすることで、従来の画像表現と比較して行動認識性能が向上するか?
  • RQ3ImageNetからPOF-SMドメインへの転移学習が、単一画像行動認識タスクに適した深層CNNを効果的に適応させられるか?
  • RQ4本手法は、動画から抽出した大規模で現実的な静止画像データセットにおいて、どのように性能を発揮するか?
  • RQ5本モデルは、人間-物体の相互作用に依存しない、身体の動きに依存する行動に一般化できるか?

主な発見

  • 提案手法は、Willowデータセットにおいて最先端の性能を達成し、既存の単一画像行動認識手法を上回った。
  • 200万枚以上の画像を含む新規のUCFSI-101データセットでは、先行研究の最先端手法を顕著に上回る性能を示した。
  • 予測された光流と顕著性マップの組み合わせが、静止画像における時間的情報の欠落を補う強力な判別的特徴を提供した。
  • ImageNetで事前学習済みのCNNをPOF-SMドメインで微調整することで、顕著な性能向上が得られ、ドメイン適応戦略の有効性が裏付けられた。
  • 本手法は、文脈的な物体が欠落している状況においても、身体の動きに依存する行動に良好に一般化でき、頑健性を示した。
  • 人間が未来の動きを予測し、顕著な身体部位に注意を向ける能力が、静止画像行動認識に強力な事前知識であることが結果から確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。