Skip to main content
QUICK REVIEW

[論文レビュー] Covariance of Motion and Appearance Featuresfor Spatio Temporal Recognition Tasks

Subhabrata Bhattacharya, Nasim Souly|arXiv (Cornell University)|Jun 16, 2016
Human Pose and Action Recognition参考文献 13被引用数 5
ひとこと要約

本稿では、空間的時間的特徴の共分散行列を用いて動きと外見特徴の連合統計を捉える、新たな動画記述子を提案する。この記述子により、人間の行動およびジェスチャー認識が強力に実現可能となる。2次統計で特徴をモデル化し、対称正定値行列の多様体上でのスパースコーディングを採用することで、1ショットジェスチャー認識において最先端の性能を達成し、CGD 2011データセットで平均74.3%の精度を記録。HOG-HOF、MBH、STIPベースラインを上回った。

ABSTRACT

In this paper, we introduce an end-to-end framework for video analysis focused towards practical scenarios built on theoretical foundations from sparse representation, including a novel descriptor for general purpose video analysis. In our approach, we compute kinematic features from optical flow and first and second-order derivatives of intensities to represent motion and appearance respectively. These features are then used to construct covariance matrices which capture joint statistics of both low-level motion and appearance features extracted from a video. Using an over-complete dictionary of the covariance based descriptors built from labeled training samples, we formulate low-level event recognition as a sparse linear approximation problem. Within this, we pose the sparse decomposition of a covariance matrix, which also conforms to the space of semi-positive definite matrices, as a determinant maximization problem. Also since covariance matrices lie on non-linear Riemannian manifolds, we compare our former approach with a sparse linear approximation alternative that is suitable for equivalent vector spaces of covariance matrices. This is done by searching for the best projection of the query data on a dictionary using an Orthogonal Matching pursuit algorithm. We show the applicability of our video descriptor in two different application domains - namely low-level event recognition in unconstrained scenarios and gesture recognition using one shot learning. Our experiments provide promising insights in large scale video analysis.

研究の動機と目的

  • 動きと外見特徴を独立して扱う従来の行動認識手法の限界を是正し、それらの間の連合統計的関係を損なわないようにする。
  • 低レベルの動きと外見特徴の共分散を捉える統一された動画記述子を構築し、識別性能を向上させる。
  • リーマン多様体上でのスパース表現に適した判別的かつコンパクトな記述子を構築することで、ジェスチャー認識における効果的な1ショット学習を実現する。
  • 対称正定値行列の多様体上でのスパース近似を定式化することで、共分散行列の取り扱いに伴う計算的・幾何的課題を克服する。
  • 特に訓練データが限られる状況下でも、大規模な動画解析において本記述子の有効性を実証する。

提案手法

  • 各画素でオプティカルフロー(動き)および1次および2次強度勾配(外見)からキネマティック特徴を抽出する。
  • これらの16次元特徴ベクトルを用いて、1つの動画クリップごとに16×16の共分散行列を構築し、動きと外見の連合2次統計を捉える。
  • 共分散行列の上三角部分の対数を用いて、各クリップに対して136次元の記述子を生成する。
  • 対称正定値行列のリーマン多様体上でのスパース近似問題として分類を定式化し、行列式最大化(MAXDET最適化)を用いる。
  • ベクトル空間の代替手法として、直交一致 Pursuit(OMP)を用いてクエリ共分散行列を訓練記述子の辞書に射影する。
  • 最終的な動画レベル分類のため、クリップレベルの投票戦略を適用し、最近傍探索またはスパースコーディングに基づく推論を実行する。

実験結果

リサーチクエスチョン

  • RQ1共分散行列による動きと外見特徴の連合統計を表現することで、独立した特徴統合に比べ、人間の行動およびジェスチャー認識の性能が向上するか?
  • RQ21つの訓練例しか利用できない1ショット学習の状況下で、提案された共分散記述子はどの程度効果的か?
  • RQ3対称正定値行列のリーマン多様体上で共分散行列をモデル化することで、標準的なベクトル空間スパースコーディングに比べて分類性能が向上するか?
  • RQ4動き、強度勾配、位置情報の異なる組み合わせが、記述子の識別力にどのように影響するか?
  • RQ5提案された記述子は、各クラスのデータが最小限の多様で制約のない動画データセットに一般化可能か?

主な発見

  • 提案されたLCOV記述子は、CGD 2011の1ショットジェスチャー認識ベンチマークで平均74.3%の精度を達成し、MBH(66.7%)、STIP(25.0%)、TPM(34.7%)のベースラインを顕著に上回った。
  • 動きに加えて強度勾配および位置情報の統合により、動きのみの特徴に比べて認識精度が11%向上し、マルチモーダル特徴統合の重要性を示した。
  • いくつかの開発バッチ(例:Devel05)では、最高で100%の精度を達成し、訓練データが限られる1ショット状況下でも優れた一般化性能を示した。
  • 可視化により、HOG-HOFに比べて3次元空間でより明確で分離性の高いクラスタを形成していることが確認され、より優れた識別性能を示した。
  • MAXDET最適化を用いたリーマンスパースコーディングは、ベクトル空間のOMP代替手法に比べて優れた性能を示し、多様体に基づく定式化の幾何的妥当性を裏付けた。
  • 誤り行列の分析から、10の開発バッチすべてで一貫した性能を示し、特に重要なジェスチャークラスにおいて高い精度を維持しており、実世界の設定でも強固で信頼性の高い性能を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。