Skip to main content
QUICK REVIEW

[論文レビュー] Embedding Expansion: Augmentation in Embedding Space for Deep Metric Learning

Byungsoo Ko, Geonmo Gu|arXiv (Cornell University)|Mar 5, 2020
Face recognition and analysis参考文献 11被引用数 7
ひとこと要約

本論文では、深層度量学習における埋め込み空間におけるシンプルでありながら効果的なデータ拡張技術、埋め込み拡張(EE)を提案する。同じクラスのペア間における線形補間を用いた合成点の生成とハードネガティブマイニングを実行することで、追加のネットワークを必要とせず、計算コストを最小限に抑えつつ、画像検索およびクラスタリングベンチマークで最先端の結果を達成する。

ABSTRACT

Learning the distance metric between pairs of samples has been studied for image retrieval and clustering. With the remarkable success of pair-based metric learning losses, recent works have proposed the use of generated synthetic points on metric learning losses for augmentation and generalization. However, these methods require additional generative networks along with the main network, which can lead to a larger model size, slower training speed, and harder optimization. Meanwhile, post-processing techniques, such as query expansion and database augmentation, have proposed the combination of feature points to obtain additional semantic information. In this paper, inspired by query expansion and database augmentation, we propose an augmentation method in an embedding space for pair-based metric learning losses, called embedding expansion. The proposed method generates synthetic points containing augmented information by a combination of feature points and performs hard negative pair mining to learn with the most informative feature representations. Because of its simplicity and flexibility, it can be used for existing metric learning losses without affecting model size, training speed, or optimization difficulty. Finally, the combination of embedding expansion and representative metric learning losses outperforms the state-of-the-art losses and previous sample generation methods in both image retrieval and clustering tasks. The implementation is publicly available.

研究の動機と目的

  • 追加の生成ネットワークを必要とする従来のデータ拡張手法が引き起こすモデルサイズの増大とトレーニングの複雑化という制限を解消すること。
  • 線形補間のみを用いて埋め込み空間に情報豊富な合成サンプルを生成することで、度量学習の一般化性能と性能を向上させること。
  • 追加のモデル容量や最適化の難易度を導入せずに、効果的なハードネガティブマイニングを可能とすること。
  • 既存のペアベースの度量学習損失と互換性がある、即挿し可能な拡張手法を提供すること。
  • アーキテクチャの変更なしに、画像検索およびクラスタリングタスクで最先端の性能を達成すること。

提案手法

  • 同じクラスのサンプルペア間の線形補間を用いて合成埋め込み点を生成し、線分をn+1等分することでn個の合成点を生成する。
  • 元の点と合成点のすべての組み合わせに対してハードネガティブペアマイニングを適用し、トレーニングに最も挑戦的なネガティブペアを選択する。
  • 生成ネットワークや複雑な演算を必要とせず、完全に埋め込み空間内で動作する。
  • トライアングル損失、Nペア損失、リフトド構造損失、MS損失など、任意のペアベースの度量学習損失と互換性がある。
  • 合成点の生成は単純な線形代数に依存するため、計算効率が高く、ほとんどオーバーヘッドがない。
  • 最終モデルはベースモデルと同一のアーキテクチャとトレーニングパイプラインを維持し、合成点を含む損失計算のみが変更される。

実験結果

リサーチクエスチョン

  • RQ1埋め込み空間における線形補間による空間内データ拡張が、モデルパラメータの追加なしに度量学習性能を向上させることができるか?
  • RQ2同じクラスのペアから合成点を生成し、それらの間でハードネガティブマイニングを実施することで、標準的なトレーニングに比べて一般化性能が向上するか?
  • RQ3GAN やオートエンコーダーに依存する既存のサンプル生成技術と比較して、性能と効率の面で本手法は優れているか?
  • RQ4本手法は、さまざまなペアベースの度量学習損失に普遍的に適用可能であり、一貫した性能向上をもたらすか?
  • RQ5合成点の数が増加するにつれて性能向上が見られるか。また、計算コストは管理可能か?

主な発見

  • 埋め込み拡張は、評価されたすべての度量学習損失で顕著な性能向上を示し、最良の組み合わせ(EE + MS損失)では、スタンフォード・オンラインプロダクトスデータセットでNMI 63.3%、Recall@1 46.1%を達成した。
  • CARS196データセットでは、EE + MS損失がベースラインのトライアングル損失と比較して、Recall@1で12.1%、NMIで7.4%の向上を達成した。
  • DAML や HDML といった従来のサンプル生成手法と比較して、SOP のような大規模データセットを含むすべてのベンチマークで優れた性能を示し、追加の生成ネットワークを用いた手法ですら上回った。
  • 合成点の生成に伴う計算オーバーヘッドは無視できるほど小さく、表1に示すように、バッチあたりn=32の合成点生成に0.0023msの追加時間しかかからない。
  • CUB200-2011、CARS196、SOP の複数のデータセットおよび検索とクラスタリングの両方のタスクにおいて、一貫した性能向上を示しており、広範な適用可能性を示している。
  • 大規模なデータセットでカテゴリ数が多い環境において、性能向上が顕著に現れ、EEが高変動性の状況下で合成点から得られる意味的情報を効果的に活用できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。