Skip to main content
QUICK REVIEW

[論文レビュー] Deep manifold-to-manifold transforming network for action recognition

Tong Zhang, Wenming Zheng|arXiv (Cornell University)|May 30, 2017
Human Pose and Action Recognition参考文献 2被引用数 3
ひとこと要約

本稿では、対称正定値(SPD)行列を1つのリーマン多様体からより判別性の高い多様体へ写像するエンドツーエンドのディープラーニングフレームワーク、Deep Manifold-to-Manifold Transforming Network(DMT-Net)を提案する。本研究では、SVDを用いないSPD構造を保持する新規レイヤー—局所SPD畳み込み層、非線形SPD活性化層、リーマン多様体を保全する再帰層—を導入し、アクション認識ベンチマークで最先端の性能を達成した。

ABSTRACT

Symmetric positive definite (SPD) matrices (e.g., covariances, graph Laplacians, etc.) are widely used to model the relationship of spatial or temporal domain. Nevertheless, SPD matrices are theoretically embedded on Riemannian manifolds. In this paper, we propose an end-to-end deep manifold-to-manifold transforming network (DMT-Net) which can make SPD matrices flow from one Riemannian manifold to another more discriminative one. To learn discriminative SPD features characterizing both spatial and temporal dependencies, we specifically develop three novel layers on manifolds: (i) the local SPD convolutional layer, (ii) the non-linear SPD activation layer, and (iii) the Riemannian-preserved recursive layer. The SPD property is preserved through all layers without any requirement of singular value decomposition (SVD), which is often used in the existing methods with expensive computation cost. Furthermore, a diagonalizing SPD layer is designed to efficiently calculate the final metric for the classification task. To evaluate our proposed method, we conduct extensive experiments on the task of action recognition, where input signals are popularly modeled as SPD matrices. The experimental results demonstrate that our DMT-Net is much more competitive over state-of-the-art.

研究の動機と目的

  • アクション認識のため、リーマン多様体上に埋め込まれたSPD行列から判別性の高い特徴を学習する課題に対処すること。
  • 従来のSPDディープラーニング手法におけるSVDベースの演算による高コストを克服すること。
  • リーマン多様体上での再帰層を用いて、アクションシーケンスの時間的ダイナミクスを効果的にモデル化すること。
  • 高価な行列対数やSVDに依存しない効率的な距離計算を設計すること。
  • すべてのレイヤーでSPD構造を保持する統合的でエンドツーエンドで訓練可能なネットワークを構築し、表現学習を向上させること。

提案手法

  • フィルタをSPD行列に制約する局所SPD畳み込み層を提案し、理論的証明により多様体の保存を保証する。
  • 指数関数や双曲線正弦・余弦などの要素ごとの演算(例:exp, sinh, cosh)を用いた非線形SPD活性化層を導入し、SVDを回避するとともにシュール積定理によりSPD構造を維持する。
  • GRUにインspiredされたリーマン多様体を保全する再帰層を設計し、すべての演算(双線形射影、活性化、ハダマード積)がSPD特性を保つことを理論的に証明した。
  • SPD行列を対角形式に変換する対角化SPDレイヤーを統合し、SVDを用いずに効率的な対数・ユークリッド距離計算を可能にした。
  • SPD特徴が複数のリーマン多様体を渡って流れることを許容する多様体間変換戦略を採用し、判別力の向上を図った。
  • すべてのモジュールを統合し、アクション認識のためのエンドツーエンドで同時に訓練可能なディープネットワークを構築し、各段階でSPD保存の理論的保証を提供した。

実験結果

リサーチクエスチョン

  • RQ1SPD行列上で局所畳み込みフィルタリングを実行する際、そのリーマン多様体構造をどのように保証できるか?
  • RQ2SVDや行列対数を必要とせずに、SPD行列用の非線形活性化関数を設計できるか?
  • RQ3時間的依存性をモデル化するため、再帰的学習をリーマン多様体に一般化できるか?
  • RQ4計算コストの高いSVDや行列対数に依存せずに、SPD行列の効率的な距離計算を達成できるか?
  • RQ5既存のSOTA手法と比較して、多様体間ディープネットワークは、どれほどアクション認識性能を向上させるか?

主な発見

  • DMT-Netは、複数のアクション認識ベンチマークで最先端の性能を達成し、既存のSOTA手法を上回った。
  • 提案された局所SPD畳み込み層は、SVDを用いずにリーマン多様体構造を保持し、効果的な局所特徴学習を可能にした。
  • 非線形SPD活性化層は、要素ごとの演算を用いてSVDを回避し、シュール積定理によりSPD特性を維持した。
  • リーマン多様体を保全する再帰層は、時間ステップにわたってSPD構造を維持しながら、長距離の時間的依存性を効果的にモデル化した。
  • 対角化SPDレイヤーにより、効率的な対数・ユークリッド距離計算が可能になり、計算コストを削減しながら分類精度を維持した。
  • 広範な実験により、DMT-Netがさまざまなデータセットで一貫して先行手法を上回ることを確認し、その頑健性と一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。