Skip to main content
QUICK REVIEW

[論文レビュー] Deep Image Category Discovery using a Transferred Similarity Function

Yen-Chang Hsu, Zhaoyang Lv|arXiv (Cornell University)|Dec 5, 2016
Advanced Image and Video Retrieval Techniques参考文献 24被引用数 12
ひとこと要約

本論文は、オムニグラットなどのソースドメインから事前学習された類似度関数を、弱い2値ペairwise制約を介してラベルなし自然画像内のオブジェクトカテゴリを発見するために転送するエンドツーエンドのディープクラスタリングフレームワークを提案する。密度的でノイズの多い類似度予測を監視信号として活用することで、MNIST、CIFAR-10、STL-10、ImageNetで最先端の性能を達成し、ドメインシフトに対して頑健であり、大規模データセットへのスケーラビリティも示している。

ABSTRACT

Automatically discovering image categories in unlabeled natural images is one of the important goals of unsupervised learning. However, the task is challenging and even human beings define visual categories based on a large amount of prior knowledge. In this paper, we similarly utilize prior knowledge to facilitate the discovery of image categories. We present a novel end-to-end network to map unlabeled images to categories as a clustering network. We propose that this network can be learned with contrastive loss which is only based on weak binary pair-wise constraints. Such binary constraints can be learned from datasets in other domains as transferred similarity functions, which mimic a simple knowledge transfer. We first evaluate our experiments on the MNIST dataset as a proof of concept, based on predicted similarities trained on Omniglot, showing a 99\% accuracy which significantly outperforms clustering based approaches. Then we evaluate the discovery performance on Cifar-10, STL-10, and ImageNet, which achieves both state-of-the-art accuracy and shows it can be scalable to various large natural images.

研究の動機と目的

  • ラベルなしデータが存在する自然画像における教師なし画像カテゴリ発見の課題に対処すること。
  • 弱く転送された知識からエンドツーエンド学習を可能にすることで、偏りのあるメトリクス学習およびクラスタリングパイプラインへの依存を低減すること。
  • ソースドメインからの密度的ペアワイズ類似度制約を活用することで、複雑で現実的なデータセットにおけるクラスタリング性能を向上させること。
  • ノイズの多い類似度予測が生じるにもかかわらず、ImageNetのような大規模データセットへのスケーラビリティと頑健性を実証すること。

提案手法

  • 2値類似度ラベルを画像ペア間で予測するように、ソースデータセット(例:Omniglot)上でシアンプスネットワークアーキテクチャを学習する。
  • 訓練済みの類似度予測ネットワーク(SPN)を固定し、ターゲットドメインでの転送類似度関数として使用する。
  • 固定されたSPNの予測結果を弱い監視信号として用い、ラベルなしターゲット画像上でエンドツーエンドに学習する共同クラスタリングネットワーク(ClusterNet)を訓練する。
  • 対照的損失を適用して、転送された類似度制約に基づくクラスタリング構造を強制する。
  • エンドツーエンドで深層特徴表現とクラスタ割り当てを教師なしで同時に学習する。
  • t-SNE可視化を用いて、学習されたクラスタ埋め込みの質を評価および解釈する。

実験結果

リサーチクエスチョン

  • RQ1ソースドメインから転送された類似度関数は、ラベルなしのターゲットドメインで効果的な教師なし画像カテゴリ発見を可能にするか?
  • RQ2ソースとターゲット間のドメインシフトに起因するノイズの多い類似度予測に対して、この手法はどれほど頑健か?
  • RQ3提案されたエンドツーエンドクラスタリングフレームワークは、従来の2段階メトリクス学習およびクラスタリングパイプラインを上回る性能を示すか?
  • RQ4ImageNetのような大規模自然画像データセットに対しても、この手法は効果的にスケーリングできるか?
  • RQ5SPNがこれらのクラスで学習されていなくても、フレームワークは細分化されたカテゴリ(例:クロウ・ストルク 対 インディゴ・バンティング)を発見できるか?

主な発見

  • MNISTでは、Omniglotで学習した類似度予測を用いて99%の精度を達成し、クラスタリングベースラインを著しく上回った。
  • CIFAR-10では、テストセットでNMIが0.750、ACCが0.750を達成し、比較した全クラスタリング手法を上回った。
  • ImageNet-10Rでは、テストセットでNMIが0.707、ACCが0.750を達成し、細分化された自然画像カテゴリにおいて強力な性能を示した。
  • t-SNE可視化では、ブラックストールクとインディゴバンティングのような類縁カテゴリが明確に分離されており、有効なクラスタ発見を示している。
  • ドメインシフトに起因するノイズの多い類似度予測に対しても、密度的ペアワイズ制約の活用により、この手法は頑健であり、正確なクラスタリングを可能にした。
  • MNIST、CIFAR-10、STL-10、ImageNetを含む複数のベンチマークで最先端の性能を達成し、スケーラビリティと一般化能力を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。