Skip to main content
QUICK REVIEW

[論文レビュー] Deep Metric Learning Meets Deep Clustering: An Novel Unsupervised Approach for Feature Embedding

Binh X. Nguyen, B. D. Nguyen|arXiv (Cornell University)|Sep 9, 2020
Video Surveillance and Tracking Methods参考文献 55被引用数 8
ひとこと要約

本論文は、教師なしの深層度画像学習における正例/負例サンプルのマイニングの課題を克服するため、深層クラスタリングと度画像学習を統合した新規な教師なし深層度画像学習手法CBSwRを提案する。クラスタリングにより擬似ラベルを学習し、それらをもとにセンターに基づく度画像損失をガイドすることで、CUB200-2011およびCARS196で最先端のリtrieval性能を達成した。従来の教師なし手法に比べてリtrievalの再現率指標で優れた性能を示し、同時に高いクラスタリング品質を維持した。

ABSTRACT

Unsupervised Deep Distance Metric Learning (UDML) aims to learn sample similarities in the embedding space from an unlabeled dataset. Traditional UDML methods usually use the triplet loss or pairwise loss which requires the mining of positive and negative samples w.r.t. anchor data points. This is, however, challenging in an unsupervised setting as the label information is not available. In this paper, we propose a new UDML method that overcomes that challenge. In particular, we propose to use a deep clustering loss to learn centroids, i.e., pseudo labels, that represent semantic classes. During learning, these centroids are also used to reconstruct the input samples. It hence ensures the representativeness of centroids - each centroid represents visually similar samples. Therefore, the centroids give information about positive (visually similar) and negative (visually dissimilar) samples. Based on pseudo labels, we propose a novel unsupervised metric loss which enforces the positive concentration and negative separation of samples in the embedding space. Experimental results on benchmarking datasets show that the proposed approach outperforms other UDML methods.

研究の動機と目的

  • 教師なし深層度画像学習(UDML)において、クラスラベルが入手できない状況下で正例と負例のサンプルマイニングの課題に対処すること。
  • 全データセット上で計算コストの高いペairワイズまたはトリプレットマイニングに依存することを減らすことで、UDMLにおける学習効率を向上させること。
  • 意味的グルーピングを可能にするために、代表的なクラスターセンタ(代表的クラスタ中心)を学習し、それらを擬似ラベルとして用いることで、教師なしの度画像学習を有効に実現すること。
  • 特にゼロショットおよび低リソース環境において、教師なし特徴埋め込みとリtrievalで最先端の性能を達成すること。

提案手法

  • 本手法は、学習可能なクラスタリングヘッド、再構成損失、およびセンターに基づく度画像損失を統合した新規な損失関数を導入し、クラスタリングと度画像学習を同時に最適化する。
  • 擬似ラベルは、入力サンプルを学習可能なセンタに割り当てる微分可能クラスタリングヘッドにより生成され、埋め込み空間における意味的クラスを表す。
  • 動的統計を用いたモーメンタムベースの更新により、訓練中にセンタを更新することで、安定的かつ代表的なクラスタ中心を保証する。
  • 度画像損失は、擬似ラベルを監視信号として用い、クラスタ内での凝集(正例の集中)とクラスタ間での分離(負例の分離)を強制する。
  • 再構成損失は、入力サンプルをそのクラスタセンタから再構成することを目的とし、センタが視覚的パターンを適切に代表していることを保証する。
  • 擬似ラベルを用いて正例・負例のセットを定義することで、明示的なトリプレットやペアマイニングを回避し、計算複雑性を低減する。

実験結果

リサーチクエスチョン

  • RQ1教師ありラベルが存在しない状況下で、深層クラスタリングを効果的に活用して信頼性の高い擬似ラベルを生成し、教師なし度画像学習に応用できるか?
  • RQ2教師なし状況下で、擬似ラベルを用いて、トリプレットまたはペアワイズ度画像学習のための意味のある正例・負例を定義できるか?
  • RQ3クラスタリング、再構成、度画像学習の共同最適化が、従来の教師なし度画像学習手法よりも優れた特徴埋め込みを達成できるか?
  • RQ4提案手法は、教師ありおよび教師なしの度画像学習ベースラインと比較して、リtrievalベンチマークで競争力のある性能を示せるか?

主な発見

  • CUB200-2011データセットでは、CBSwRはR@8で80.5%の再現率を達成し、以前の最先端の教師なし手法SME(80.2%)を上回り、すべてのR@K指標で他の教師なし手法と同等以上であった。
  • CARS196データセットでは、CBSwRはR@8で76.0%の再現率を達成し、MOMやSMEを含むすべての教師なし手法を上回り、教師あり手法に近い性能を示した。
  • CBSwRはCARS196で37.6%の正規化相互情報量(NMI)スコアを達成し、最先端の教師なしクラスタリング手法と同等の高いクラスタリング品質を示した。
  • 本手法は、リtrievalおよびクラスタリング両面で、以前の最先端の教師なし度画像学習手法SMEを上回ったことから、クラスタリングと度画像学習を統合したフレームワークの有効性が裏付けられた。
  • アブレーションスタディの結果、再構成損失とセンターに基づく度画像損失の両方が最適な性能を達成するために不可欠であることが確認され、それぞれが埋め込み品質の向上に寄与した。
  • トリプレット損失にスマートマイニングを適用した手法やプロキシベースのトリプレット損失といった教師あり手法と比較しても、CBSwRは競争力のある性能を示した。これは、ゼロショット環境における優れた転送性と一般化能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。