[論文レビュー] Sparse Coding of Shape Trajectories for Facial Expression and Action Recognition
本稿では、Kendallの形状空間における2次元/3次元ランドマーク軌道をモデル化することで、顔の表情および行動認識のためのリーマンスパースコーディングと辞書学習(SCDL)を提案する。2次元顔の表情に対しては再生成核ヒルバート空間(RKHS)における外在的SCDLを、3次元骨格的行動に対しては接空間上の内在的SCDLを用い、非線形多様体における判別的でスパースかつベクトル空間互換の表現により、最先端の手法と同等の性能を達成する。
The detection and tracking of human landmarks in video streams has gained in reliability partly due to the availability of affordable RGB-D sensors. The analysis of such time-varying geometric data is playing an important role in the automatic human behavior understanding. However, suitable shape representations as well as their temporal evolution, termed trajectories, often lie to nonlinear manifolds. This puts an additional constraint (i.e., nonlinearity) in using conventional Machine Learning techniques. As a solution, this paper accommodates the well-known Sparse Coding and Dictionary Learning approach to study time-varying shapes on the Kendall shape spaces of 2D and 3D landmarks. We illustrate effective coding of 3D skeletal sequences for action recognition and 2D facial landmark sequences for macro- and micro-expression recognition. To overcome the inherent nonlinearity of the shape spaces, intrinsic and extrinsic solutions were explored. As main results, shape trajectories give rise to more discriminative time-series with suitable computational properties, including sparsity and vector space structure. Extensive experiments conducted on commonly-used datasets demonstrate the competitiveness of the proposed approaches with respect to state-of-the-art.
研究の動機と目的
- 時間的ランドマークデータにおける非線形形状多様体の挑戦に応えること。
- 2次元および3次元のKendallの形状空間における形状軌道の統一的フレームワークを構築すること。
- 顔の表情および行動認識における最適なパフォーマンスを達成するため、内在的および外在的SCDLソリューションを比較すること。
- 多様体値の軌道をスパースで判別的な時系列に変換することにより、ベクトル空間における効果的な時系列モデリングと分類を可能にすること。
- 標準ベンチマークを用いて、マクロおよびマイクロ表情認識および3次元行動認識の分野において、提案手法の有効性を示すこと。
提案手法
- 2次元/3次元ランドマーク系列をKendallの形状空間における軌道として表現することで、視点不変の分析を実現する。
- 2次元顔の軌道をProcrustesガウスカーネルを用いて再生成核ヒルバート空間(RKHS)に埋め込むことにより、外在的SCDLを適用する。
- 3次元骨格的軌道に対しては、多様体上の基準点の接空間にデータを射影することで、内在的SCDLを実装する。
- 訓練データからリーマン辞書を学習し、形状軌道のスパースコーディングを可能にするとともに、幾何的構造を保持する。
- スパースコードをユークリッド空間における時系列モデリングおよび分類のための判別的特徴として使用する。
- 分類タスクのために、標準的な分類器(例:SVM)を結果のスパース時系列に適用する。
実験結果
リサーチクエスチョン
- RQ1外在的SCDL(RKHS内)は、2次元顔の表情認識において、特に微細なマクロおよびマイクロ表情に対してどれほど有効であるか?
- RQ23次元行動認識において、接空間上での内在的SCDLは外在的SCDLと比較して、性能および耐性の面でどのように異なるか?
- RQ3Kendallの形状空間における形状軌道のスパースコーディングは、元のランドマーク系列と比較して、より判別的でノイズに強い特徴を生成できるか?
- RQ4カーネル選択およびパrameter選択(例:Procrustesガウスカーネルにおけるσ)が、3次元形状空間における外在的SCDLのパフォーマンスに与える影響は何か?
- RQ5提案フレームワークは、マイクロ表情を含むさまざまなデータセットおよび表情タイプに一般化可能か?
主な発見
- Procrustesガウスカーネルを用いた外在的SCDLは、CK+データセットにおける軽微な嫌悪感情など、微細な感情に対して、内在的SCDLを上回る性能を示した。
- 外在的アプローチは、2次元マイクロ表情認識においても、微細な形状変形を捉える能力を確認し、有望な結果を得た。
- 3次元行動認識においては、内在的SCDLが優れたパフォーマンスを達成した。これは、3次元Kendall空間に正定値カーネルが利用できないため、外在的SCDLの有効性が制限されていたためである。
- 提案されたスパースコーディングフレームワークは、判別的でノイズに強く、ベクトル空間と互換性のある特徴を生成し、ユークリッド空間における効果的な分類を可能にした。
- 広範な実験により、顔の表情および行動認識の標準ベンチマークにおいて、最先端の手法と同等の競争力を持つことが示された。
- 比較的スタディにより、内在的SCDLは基準点における接空間近似に起因する歪みを回避するため、大規模な変動を示す3次元データに対してより適していることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。