Skip to main content
QUICK REVIEW

[論文レビュー] Manifold Regularized Slow Feature Analysis for Dynamic Texture Recognition

Jie Miao, Xiangmin Xu|arXiv (Cornell University)|Jun 9, 2017
Image Retrieval and Classification Techniques参考文献 44被引用数 3
ひとこと要約

本稿では、動的テクスチャ認識のための多様体正則化スローフィーチャー分析(MR-SFA)を提案する。標準的なSFAに多様体正則化を組み込むことで、動画シーケンスからゆっくり変化する局所的予測可能な特徴を学習する。畳み込み特徴抽出、プーリング、およびフィッシャー特徴ベクトル符号化を統合することで、低解像度で複雑な動的テクスチャ動画において、従来のSFAおよびCNNベースの手法を上回る最先端の性能を達成している。

ABSTRACT

Dynamic textures exist in various forms, e.g., fire, smoke, and traffic jams, but recognizing dynamic texture is challenging due to the complex temporal variations. In this paper, we present a novel approach stemmed from slow feature analysis (SFA) for dynamic texture recognition. SFA extracts slowly varying features from fast varying signals. Fortunately, SFA is capable to leach invariant representations from dynamic textures. However, complex temporal variations require high-level semantic representations to fully achieve temporal slowness, and thus it is impractical to learn a high-level representation from dynamic textures directly by SFA. In order to learn a robust low-level feature to resolve the complexity of dynamic textures, we propose manifold regularized SFA (MR-SFA) by exploring the neighbor relationship of the initial state of each temporal transition and retaining the locality of their variations. Therefore, the learned features are not only slowly varying, but also partly predictable. MR-SFA for dynamic texture recognition is proposed in the following steps: 1) learning feature extraction functions as convolution filters by MR-SFA, 2) extracting local features by convolution and pooling, and 3) employing Fisher vectors to form a video-level representation for classification. Experimental results on dynamic texture and dynamic scene recognition datasets validate the effectiveness of the proposed approach.

研究の動機と目的

  • 非剛性変形や空間的・時間的平行移動を含む、複雑な時間的変動を示す動的テクスチャを認識する課題に対処すること。
  • 時間的複雑性のため、標準的なスローフィーチャー分析(SFA)が生の動的テクスチャから強力な高レベル表現を直接抽出できないという限界を克服すること。
  • 時間的遷移における局所性を保つ多様体正則化を統合することで、SFAを改善し、特徴がゆっくり変化するとともに、ある程度予測可能であるようにすること。
  • 深層学習手法が効果を発揮しない低解像度および小物動的テクスチャ動画に適した、効率的で低複雑性の特徴抽出パイプラインを開発すること。
  • Bag-of-Wordsモデリングを用いて、視点、スケール、空間的・時間的平行移動に対して不変な動画レベルの表現を実現すること。

提案手法

  • 各遷移の初期状態に基づいて、時間的遷移間の近傍関係を構築し、データ多様体における局所構造をモデル化する。
  • 学習された特徴の変動を制約するため、多様体正則化を適用し、入力空間における近い初期状態が、類似したゆっくり変化する出力をもたらすように保証する。
  • MR-SFAを用いて畳み込みフィルタとして特徴抽出関数を学習し、動画ボリュームから局所的でゆっくり変化する特徴を抽出する。
  • 畳み込みとマックスプーリングを実行することで、ロバスト性と空間不変性を向上させる局所的特徴抽出を実現する。
  • 全動画をフィッシャー・ベクトルで表現することで、コンactで判別力のある動画レベルの表現を形成する。
  • 局所的特徴の分布をモデル化するため、ガウス・ミックスチャネル(GMMs)を用いたBag-of-Wordsモデルを用い、空間的および時間的シフトに対して不変性を実現する。

実験結果

リサーチクエスチョン

  • RQ1多様体正則化は、動的テクスチャ認識におけるスローフィーチャー分析のロバスト性と予測能力を向上させることができるか?
  • RQ2MR-SFAは、動的テクスチャの複雑な時間的変動を解消する、ゆっくり変化し、局所的に予測可能な特徴をどの程度効果的に抽出できるか?
  • RQ3MR-SFAは、ベンチマーク動的テクスチャデータセットにおいて、標準SFAおよびC3DやSA-CNNなどの最先端のCNNベースの手法やLDSベースの手法と比較して、どのように性能を発揮するか?
  • RQ4深層学習モデルが効果を発揮しない低解像度、小物動的テクスチャ動画において、MR-SFAは競争力のある性能を達成できるか?
  • RQ5多様体正則化の統合により、GMMとフィッシャー・ベクトルを用いた動画表現において、クラスタリングおよび分類性能が向上するか?

主な発見

  • MR-SFAは、DynTexおよびDynTex++データセットで最先端の性能を達成し、標準SFAおよびMBSIF-TOPを顕著に上回っている。
  • DynTex++データセットでは、低解像度・小物動画にあまり効果を発揮しないC3DやSA-CNNなどのCNNベースのモデルよりもMR-SFAが優れている。
  • DynTex++データセットで8つのフィルタを用いた場合、特徴抽出速度は1秒あたり41.6フレームに達し、低解像度動画における計算効率を示している。
  • MR-SFA特徴は均等に分布しており、LDS特徴の高次元非線形パラメータとは異なり、少数のGMMクラスタで効果的にモデル化できる。
  • YUPENNデータセットでは、複雑な時間的遷移が少ないため、改善は限定的であり、MR-SFAが時間的複雑性の高い動画で最も効果的であることが示唆されている。
  • 単一の畳み込み層と少ないフィルタ数でさえも、優れた結果を達成しているため、本手法の効率性と低計算コストが顕著に示されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。