Skip to main content
QUICK REVIEW

[論文レビュー] Similarity Learning via Kernel Preserving Embedding

Zhao Kang, Yiwei Lu|arXiv (Cornell University)|Mar 11, 2019
Face and Expression Recognition参考文献 30被引用数 6
ひとこと要約

本稿では、元のデータの再構成誤差ではなくカーネル行列の再構成誤差を最小化することで、グローバルな多様体構造を保持する、新しい類似度学習フレームワークであるカーネル保存埋め込み(KPE)を提案する。複数のベンチマークで最先端のクラスタリング性能を達成し、LRR、SSC、CANなどの手法を上回っている。特に低ランクおよびスパース表現タスクにおいて顕著な向上が確認され、ウィルコクソン符号順位検定により統計的に有意であることが裏付けられている。

ABSTRACT

Data similarity is a key concept in many data-driven applications. Many algorithms are sensitive to similarity measures. To tackle this fundamental problem, automatically learning of similarity information from data via self-expression has been developed and successfully applied in various models, such as low-rank representation, sparse subspace learning, semi-supervised learning. However, it just tries to reconstruct the original data and some valuable information, e.g., the manifold structure, is largely ignored. In this paper, we argue that it is beneficial to preserve the overall relations when we extract similarity information. Specifically, we propose a novel similarity learning framework by minimizing the reconstruction error of kernel matrices, rather than the reconstruction error of original data adopted by existing work. Taking the clustering task as an example to evaluate our method, we observe considerable improvements compared to other state-of-the-art methods. More importantly, our proposed framework is very general and provides a novel and fundamental building block for many other similarity-based tasks. Besides, our proposed kernel preserving opens up a large number of possibilities to embed high-dimensional data into low-dimensional space.

研究の動機と目的

  • 既存の自己表現ベースの類似度学習手法が多様体構造を無視するという限界を是正するため、元のデータの再構成に注力するのではなく、グローバルな多様体構造を保持する。
  • カーネル行列の再構成を通じて、データ内の全体的な関係を保持することで、類似度学習を向上させる。
  • クラスタリングや次元削減を含む、さまざまな類似度ベースの学習タスクに適用可能な汎用的で柔軟なフレームワークを構築する。
  • 従来のデータ再構成と比較して、カーネルベースの距離学習が内因的なデータ構造を捉える能力に優れていることを示す。
  • 高次元データの低次元埋め込みに、性能向上を伴う堅牢な基盤を提供する。

提案手法

  • 元のデータ行列の再構成ではなく、カーネル行列の再構成を行う類似度学習フレームワークを提案。各データポイントを他のデータポイントの線形結合として表現する係数行列 Z を用いる。
  • 元のカーネル行列 K と再構成カーネル行列 KZ の差のフロベニウスノルムを最小化する。すなわち、||K - KZ||_F^2 を最小化する。
  • 低ランク構造を促進するための核ノルム ||Z||_* と、スパarsityを促進するための ℓ1-ノルム ||Z||_1 を含む正則化項を導入する。
  • スペクトルクラスタリングにおいて学習された Z を類似度行列として用いることで、クラスタリングに本手法を適用する。
  • 最適化目的関数における再構成誤差と正則化項のバランスをとるために、パラメータ γ を用いる。
  • 初期のカーネル行列 K を計算するためにガウスカーネルやその他のカーネル関数を用い、埋め込みプロセス全体でそのカーネル行列を保持する。

実験結果

リサーチクエスチョン

  • RQ1類似度学習の過程でカーネル行列を保存することで、元のデータの再構成に比べてより優れた表現学習が達成できるか?
  • RQ2多様体構造を捉える観点から、カーネルベースの類似度学習は、従来の自己表現手法と比較してどのように異なるか?
  • RQ3提案されたフレームワークは、クラスタリングや次元削減といった異なる類似度ベースのタスクに一般化可能か?
  • RQ4正則化パラメータ γ のモデル性能およびロバストネスに与える影響は何か?
  • RQ5LRR、SSC、CAN などの最先端手法に比べ、カーネル保存埋め込みはクラスタリングベンチマークで優れているか?

主な発見

  • SLKE は多数のベンチマークデータセットで最高のクラスタリング精度と NMI を達成し、LRR や SSC に対して平均でそれぞれ 8.92%、8.76% の精度向上を示した。
  • ウィルコクソン符号順位検定の結果、SLKE-S および SLKE-R は SC、RKKM、SSC、LRR、SSR、CAN、TLSC と比較して p 値 < 0.05 を示し、統計的に有意であることが確認された。
  • 全データセットにわたり、SLKE-R と SLKE-S は LRR や SSC よりも平均でそれぞれ 8.92%、8.76% の精度向上を達成した。
  • 本手法はパrameter γ に対してロバストであり、10^-6 から 10^-3 の広い範囲で安定した性能を維持した。
  • t-SNE 視覚化により、SLKE はデータのクラスタ構造を良好に保持していることが確認された。特に JAFFE データセットでは、再構成されたデータが明確な分離性を保っていた。
  • COIL20 では SLKE が CAN とほぼ同等の性能を示し、困難なデータ環境下でも強い競争力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。