[論文レビュー] A Novel Space-Time Representation on the Positive Semidefinite Con for Facial Expression Recognition
本稿では、固定ランクの正定値行列のリーマン多様体上での顔のランドマークの時系列的変化を軌道としてモデル化することにより、顔の表情認識のための新規な空間時間表現を提案する。アフィン不変な形状および空間共分散情報を取り入れることで、時系列の整合性を保つ幾何学的ツール(時刻同期および適応的再サンプリング)を用いたレート不変な軌道解析が可能となり、CK+、MMI、Oulu-CASIA、AFEWの複数のデータセットで最先端の性能を達成した。CK+では96.87%、AFEWでは39.94%の精度を達成した。
In this paper, we study the problem of facial expression recognition using a novel space-time geometric representation. We describe the temporal evolution of facial landmarks as parametrized trajectories on the Riemannian manifold of positive semidefinite matrices of fixed-rank. Our representation has the advantage to bring naturally a second desirable quantity when comparing shapes -- the spatial covariance -- in addition to the conventional affine-shape representation. We derive then geometric and computational tools for rate-invariant analysis and adaptive re-sampling of trajectories, grounding on the Riemannian geometry of the manifold. Specifically, our approach involves three steps: 1) facial landmarks are first mapped into the Riemannian manifold of positive semidefinite matrices of rank 2, to build time-parameterized trajectories; 2) a temporal alignment is performed on the trajectories, providing a geometry-aware (dis-)similarity measure between them; 3) finally, pairwise proximity function SVM (ppfSVM) is used to classify them, incorporating the latter (dis-)similarity measure into the kernel function. We show the effectiveness of the proposed approach on four publicly available benchmarks (CK+, MMI, Oulu-CASIA, and AFEW). The results of the proposed approach are comparable to or better than the state-of-the-art methods when involving only facial landmarks.
研究の動機と目的
- 剛体変換に対して不変な幾何的表現を用いて動的顔の表情をモデル化する課題に対処すること。
- 標準的なアフィン形状解析を超えて、空間共分散を形状表現に統合し、識別能を向上させること。
- リーマン幾何学を用いて、顔の表情軌道のレート不変な比較と分類を可能にすること。
- 正定値コーン上でのランドマーク軌道のための時刻同期および適応的再サンプリングの計算ツールを開発すること。
- 顔のランドマークのみを用いて、複数のベンチマークデータセットで最先端の性能を達成すること。
提案手法
- グラミアン行列を介して2次元顔ランドマーク配置をランク2の正定値行列のリーマン多様体へ写像すること。
- 顔の表情の時間的変化を多様体 $\mathcal{S}^{+}(2,n)$ 上の時間パラメータ化された軌道として表現すること。
- 幾何学的整合性を保つために、軌道のレート不変な時刻同期に動的時間ワープ(DTW)を適用すること。
- 多様体上に定義された類似度測度 $d_{\mathcal{S}^{+}}$ を用いて、軌道間の(非)類似度を計算すること。
- 軌道長の標準化と分類のロバストネス向上のため、適応的再サンプリングを実装すること。
- 距離 $d_{\mathcal{S}^{+}}$ をベースにしたカーネルを有するペアワイズ近接関数SVM(ppfSVM)を用いて、効果的な分類を実現すること。
実験結果
リサーチクエスチョン
- RQ1リーマンフレームワーク内で形状と空間共分散情報を両方保持するように、顔ランドマーク軌道をどのように幾何学的に表現できるか?
- RQ2非ユークリッド多様体上でのレート不変な方法で、動的顔の表情シーケンスを効果的に比較・同期するにはどうすればよいか?
- RQ3形状表現に空間共分散を組み込むことで、アフィン形状のみを用いる手法と比較して、顔の表情認識性能がどの程度向上するか?
- RQ4時刻同期や適応的再サンプリングといった幾何学的ツールが、ベンチマークデータセットにおける分類精度をどの程度向上させるか?
- RQ5ppfSVM分類器は、正定値コーン上での非ユークリッド的軌道表現から効果的に学習できるか?
主な発見
- 提案された $\mathcal{S}^{+}(2,n)$ 上の $d_{\mathcal{S}^{+}}$ 距離は、平坦なフロベニウス距離および $d_{\mathcal{P}_n}$ 距離を上回り、CK+では96.87%の精度を達成した。
- DTWによる時刻同期により、CK+では約6%、MMIでは約12%の精度向上が見られ、レート不変解析におけるその重要性が裏付けられた。
- 適応的再サンプリングにより、MMIでは約5%、AFEWでは約3%の性能向上が得られ、分類に向けた軌道の一貫性が向上した。
- ppfSVM分類器は、AFEWで39.94%の精度を達成し、顔のランドマークのみを用いた手法の中で2位となり、メジャリティ投票によるK-NN(29.77%)を上回った。
- 外見特徴に依存せず、CK+、MMI、Oulu-CASIA、AFEWの4つのベンチマークで最先端または競争力のある結果を達成した。
- グラスマン多様体ベースの手法と比較して本手法の優位性は、正定値表現による空間共分散の組み込みが識別能を高めることに起因する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。