Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Gauss: Image-Set Matching on the Riemannian Manifold of PDFs

Mehrtash Harandi, Mathieu Salzmann|arXiv (Cornell University)|Jul 31, 2015
Face and Expression Recognition参考文献 20被引用数 12
ひとこと要約

本稿では、カーネル密度推定を用いて画像集合を確率密度関数(PDF)としてモデル化し、Riemann多様体上のCsiszár f-発散度(特にHellinger発散度とJeffrey発散度)を用いてそれらを照合する手法を提案する。分類に有用な正定値カーネルと、クラス判別的f-発散度構造を保持する教師あり次元削減手法を導入し、動的テクスチャ分類および動画ベースの顔認識において、最先端の手法を上回る性能を発揮する。

ABSTRACT

State-of-the-art image-set matching techniques typically implicitly model each image-set with a Gaussian distribution. Here, we propose to go beyond these representations and model image-sets as probability distribution functions (PDFs) using kernel density estimators. To compare and match image-sets, we exploit Csiszar f-divergences, which bear strong connections to the geodesic distance defined on the space of PDFs, i.e., the statistical manifold. Furthermore, we introduce valid positive definite kernels on the statistical manifolds, which let us make use of more powerful classification schemes to match image-sets. Finally, we introduce a supervised dimensionality reduction technique that learns a latent space where f-divergences reflect the class labels of the data. Our experiments on diverse problems, such as video-based face recognition and dynamic texture classification, evidence the benefits of our approach over the state-of-the-art image-set matching methods.

研究の動機と目的

  • カーネル密度推定を用いて非パラメトリックな確率密度関数(PDF)として画像集合を表現することで、画像集合照合におけるガウスモデルの限界を克服すること。
  • 微分同相写像に対して不変であり、統計多様体上の測地線距離と幾何的に関連するCsiszár f-発散度を活用することで、頑健な画像集合照合を実現すること。
  • 画像集合照合に向けた強力なカーネル法を可能にするために、統計多様体上に有効な正定値カーネルを構築すること。
  • f-発散度がクラスラベルと整合するように学習される潜在空間を設計する教師あり次元削減手法を考案し、判別力を向上させること。

提案手法

  • 画像特徴の複雑で非ガウス的な分布を捉えるために、カーネル密度推定を用いて各画像集合をPDFとしてモデル化する。
  • Hellinger発散度とJeffrey発散度をPDF間の類似度測度として用い、Fisher-Rao度量と幾何的に関連する微分同相写像不変性を活用する。
  • f-発散度に基づく類似度を用いて統計多様体上に正定値カーネルを構築し、SVMなどのカーネル法を分類に活用可能にする。
  • f-発散度構造のクラス判別的性質を保持するように最適化する、Grassmann多様体上での教師あり次元削減手法を提案する。
  • Monte Carlo期待値とシグモイド型変換T(W^T x)の微分を用いて、f-発散度の変換行列Wに関する閉形式勾配を導出する。
  • Riemann最適化を用いてGrassmann多様体上で目的関数を最適化し、f-発散度がクラス類縁性を反映する低次元部分空間を学習する。

実験結果

リサーチクエスチョン

  • RQ1カーネル密度推定による非パラメトリックなPDF表現は、ガウス仮定を超えて画像集合照合の性能を向上させ得るか?
  • RQ2Hellinger発散度やJeffrey発散度といったf-発散度は、統計多様体上での分布差を捉える上で、従来の指標と比較してどのように優れているか?
  • RQ3f-発散度を用いて、PDFの多様体上に有効な正定値カーネルを定義できるか?
  • RQ4f-発散度の判別的性質を低次元空間に保持するような教師あり次元削減手法を設計可能か?
  • RQ5提案手法は、実世界の動画およびテクスチャ認識タスクにおいて、最先端の画像集合照合技術を上回る性能を示すか?

主な発見

  • 提案手法であるPDFベースの画像集合照合は、動画ベースの顔認識および動的テクスチャ分類において、最先端のガウスベースの手法を上回る優れた性能を達成した。
  • Hellinger発散度とJeffrey発散度は微分同相写像に対して強く不変であるため、照明や撮影条件の変化に対しても頑健であることが示された。
  • 導出されたf-発散度勾配により、Grassmann多様体上での教師あり次元削減のための効果的最適化が可能となり、クラス分離性が向上した。
  • f-発散度に基づく正定値カーネルの使用により、カーネルマシンを用いた有効な分類が可能となり、照合精度が向上した。
  • 実験結果から、複数のベンチマークで一貫した性能向上が確認され、非パラメトリックなPDF表現がRiemann多様体上での分布多様体に有効であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。