Skip to main content
QUICK REVIEW

[論文レビュー] Improved Embeddings with Easy Positive Triplet Mining

Hong Xuan, Abby Stylianou|arXiv (Cornell University)|Apr 8, 2019
Advanced Image and Video Retrieval Techniques参考文献 25被引用数 7
ひとこと要約

本論文では、訓練中に各アーキテクチャ画像ごとに最も類似した(最も簡単な)正例を選択するシンプルで効果的な戦略、Easy Positive Triplet Miningを導入している。正例をすべてではなく最も近い正例に焦点を当てることで、埋め込みの一般化性能が向上し、CUB、SOP、In-Shop、Hotels-50Kで最先端の性能を達成した。複雑なアンサンブル法や損失関数ベースの手法を上回った。

ABSTRACT

Deep metric learning seeks to define an embedding where semantically similar images are embedded to nearby locations, and semantically dissimilar images are embedded to distant locations. Substantial work has focused on loss functions and strategies to learn these embeddings by pushing images from the same class as close together in the embedding space as possible. In this paper, we propose an alternative, loosened embedding strategy that requires the embedding function only map each training image to the most similar examples from the same class, an approach we call "Easy Positive" mining. We provide a collection of experiments and visualizations that highlight that this Easy Positive mining leads to embeddings that are more flexible and generalize better to new unseen data. This simple mining strategy yields recall performance that exceeds state of the art approaches (including those with complicated loss functions and ensemble methods) on image retrieval datasets including CUB, Stanford Online Products, In-Shop Clothes and Hotels-50K.

研究の動機と目的

  • 標準の度量学習目的(クラス内画像をすべてクラスタリングすること)と、実際のクエリ行動との不一致に対処するため。実際のクエリでは、最も類似した例だけが重要である。
  • 各アーキテクチャに対して最も簡単な正例に注目することで、クラス内ばらつきが大きい埋め込み空間における一般化性能が向上するかを調査すること。
  • 複雑な損失関数やアンサンブル手法に代わる、集中的で柔軟な代替戦略として、シンプルなマイニング戦略を提案・評価すること。

提案手法

  • 本手法は、バッチ内の各アーキテクチャ画像に対して、最も類似した(最も近い)正例を選択し、'簡単な正例'トリプレットを形成する。
  • マージンベースの目的関数を用いた標準的なトリプレット損失を使用する:max(0, ||f(x_a) - f(x_p)||_2 - ||f(x_a) - f(x_n)||_2 + margin)。
  • ハードネガティブ例と簡単な正例の両方をバランスさせるために、簡単な正例マイニングとセミハードネガティブマイニングを併用する。
  • 複数のアーキテクチャ(ResNet18、ResNet50、GoogleNet)とデータセットにわたって訓練戦略を適用し、グループサイズと埋め込み次元のアブレーションを実施する。
  • すべてのクラス内画像を1つのクラスタに押し込もうとせず、マルチモーダルな表現を可能にする。
  • CUB、SOP、In-Shop、Hotels-50K、CARで、標準的なリコールメトリクス(Recall@1、Recall@5、Recall@10)を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1各アーキテクチャに対して最も簡単な正例に注目することで、深層度量学習における一般化性能が向上するか?
  • RQ2Easy Positiveマイニングは、標準的なトリプレットマイニング、Batch All、N-pair、プロキシベース手法と比較して、リコール性能でどう異なるか?
  • RQ3シンプルなマイニング戦略が、クラス内ばらつきが大きいデータセットにおいて、複雑なアンサンブル法や損失関数ベースの最先端手法を上回ることができるか?
  • RQ4Easy Positiveマイニングは、クラス内に多様な視覚的外観が存在する場合に、より柔軟でマルチモーダルな埋め込みを生成するか?
  • RQ5Easy Positiveマイニングの性能は、異なるネットワークアーキテクチャや埋め込み次元でどのように変化するか?

主な発見

  • Easy Positive Semi-Hard Negative (EPSHN)手法は、CUB-200データセットで88.9%の新しい最先端のRecall@1を達成し、ABE や DREML といった複雑なアンサンブル手法を上回った。
  • スタンフォードオンラインプロダクト(SOP)データセットでは、最高の報告済みRecall@1を達成し、大規模でばらつきの大きいデータセットでも優れた性能を示した。
  • In-Shop クロージングスおよび Hotels-50K データセットでは、EPSHN手法が最先端の結果を達成した。特に Hotels-50K では、元の Batch All ベースラインと比較して正確性が2倍以上に向上した。
  • t-SNE ビジュアライゼーションにより、EPSHN埋め込みは N-pair や Batch All よりもより広がっており、テストデータの分布とよく一致していることが示された。
  • CAR および CUB データセットでは、ResNet18、ResNet50、GoogleNet のあらゆるアーキテクチャにおいて、EPSHNはすべての単純ベースライン(トリプレット、N-pair、プロキシ損失)を上回った。
  • 本手法はアーキテクチャや埋め込み次元に対して頑健であり、CUB および CAR ではグループサイズ16が最適で、クラスあたりのサンプル数が少ないデータセットではグループサイズ4が最適であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。