Skip to main content
QUICK REVIEW

[論文レビュー] Cross Euclidean-to-Riemannian Metric Learning with Application to Face Recognition from Video

Zhiwu Huang, Ruiping Wang|arXiv (Cornell University)|Aug 15, 2016
Face recognition and analysis参考文献 44被引用数 6
ひとこと要約

本稿では、ユークリッド空間(例:平均顔特徴)とリーマン多様体(例:グラスマン多様体やSPD多様体による動画変異の表現)の間で統一された距離メトリックを学習する、新たなフレームワークであるクロスユークリッドからリーマンメトリック学習(CERML)を提案する。両空間を共通の再生核ヒルバート空間(RKHS)にマッピングすることで、異種データタイプ間で判別的なメトリック学習が可能となり、4つのベンチマークデータセットにおいて動画から静止画、静止画から動画、動画から動画への顔認識タスクで最先端の性能を達成した。

ABSTRACT

Riemannian manifolds have been widely employed for video representations in visual classification tasks including video-based face recognition. The success mainly derives from learning a discriminant Riemannian metric which encodes the non-linear geometry of the underlying Riemannian manifolds. In this paper, we propose a novel metric learning framework to learn a distance metric across a Euclidean space and a Riemannian manifold to fuse the average appearance and pattern variation of faces within one video. The proposed metric learning framework can handle three typical tasks of video-based face recognition: Video-to-Still, Still-to-Video and Video-to-Video settings. To accomplish this new framework, by exploiting typical Riemannian geometries for kernel embedding, we map the source Euclidean space and Riemannian manifold into a common Euclidean subspace, each through a corresponding high-dimensional Reproducing Kernel Hilbert Space (RKHS). With this mapping, the problem of learning a cross-view metric between the two source heterogeneous spaces can be expressed as learning a single-view Euclidean distance metric in the target common Euclidean space. By learning information on heterogeneous data with the shared label, the discriminant metric in the common space improves face recognition from videos. Extensive experiments on four challenging video face databases demonstrate that the proposed framework has a clear advantage over the state-of-the-art methods in the three classical video-based face recognition tasks.

研究の動機と目的

  • 異種のデータ表現(ユークリッド空間とリーマン多様体)を用いた動画ベースの顔認識において、平均外見とパターン変異を統合する課題に対処すること。
  • ユークリッド空間とリーマン多様体の両方で動作する統一されたメトリック学習フレームワークを構築し、認識のロバストネスを向上させること。
  • 動画から静止画、静止画から動画、動画から動画の3つの標準的な動画顔認識タスクにおける有効なメトリック学習を可能にすること。
  • 従来のリーマンメトリック学習手法が内多様体または内ユークリッド空間学習に限定されているという限界を克服すること。
  • 共通のメトリック空間を用いて動画系列における平均と分散を共同でモデリングすることで、性能向上が達成されることを示すこと。

提案手法

  • 核埋め込み技術を用いて、ユークリッド表現とリーマン多様体表現の両方を共通の高次元の再生核ヒルバート空間(RKHS)にマッピングする。
  • 核関数を用いてリーマン多様体(グラスマン多様体やSPD多様体)をユークリッド空間に埋め込み、統一された空間で標準的なメトリック学習を可能にする。
  • 共通のRKHS内で、両源空間からの判別的情報を捉える1つのビューのユークリッド距離メトリックを学習する。
  • 異種のビュー間で共有されるラベル情報を活用してメトリック学習をガイドし、判別性を向上させる。
  • メトリック学習と幾何的整合性の両方をバランスさせる統一された目的関数を最小化する最適化技術を適用する。
  • クエリとギャラリーを異なるが整合された表現空間からのものとして扱うことで、3つの認識設定をサポートする。

実験結果

リサーチクエスチョン

  • RQ1統一されたメトリック学習フレームワークは、顔認識のための動画系列における平均外見と時間的変動を効果的に統合できるか?
  • RQ2ユークリッド空間とリーマン多様体間のクロスビュー距離メトリック学習は、動画ベースの顔認識において従来の内空間メトリック学習と比べてどのように異なるか?
  • RQ3ユークリッド表現とリーマン多様体表現を用いた平均と分散の共同モデリングは、多様な動画データセットにおいて認識精度をどの程度向上させるか?
  • RQ4提案されたフレームワークは、アーキテクチャの変更なしに、さまざまな動画認識タスク(V2S、S2V、V2V)に一般化可能か?
  • RQ5核ベースのマッピングは、クロススペースメトリック学習におけるスケーラビリティと性能にどのような影響を与えるか?

主な発見

  • CERMLは、4つの挑戦的な動画顔認識データベース(YTC、YTF、PaSC、COX)において、3つの動画認識タスクすべてで最先端の性能を達成した。
  • PaSCでは、CERML-EGが、異なる設定下で最先端手法DCCよりもV2V認識で約4%および10%の向上を達成した。
  • COXでは、CERMLはすべての競合手法を上回り、深層特徴を用いた際のSOTAディープラーニング手法VGGDeepFaceと比較して平均5%の向上を示した。
  • CERMLによる平均と分散表現の統合は、いずれの表現を単独で用いる場合よりも優れた性能を示しており、アブレーションスタディで確認された。
  • CERML-ESの最適化アルゴリズムは数十イテレーションで安定した目的関数値に収束し、良好な収束特性を示した。
  • CERMLは優れた一般化性能を示し、インターネットや監視映像に類似した動画データセットにおいて、ディープラーニングベースの手法と同等またはそれ以上の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。