Skip to main content
QUICK REVIEW

[論文レビュー] It Takes Two to Tango: Mixup for Deep Metric Learning

Shashanka Venkataramanan, Bill Psomas|arXiv (Cornell University)|Jun 9, 2021
Domain Adaptation and Few-Shot Learning参考文献 78被引用数 9
ひとこと要約

この論文では、入力サンプルとそれに対応する正例/負例ラベルの両方を補間することで表現学習を向上させる、深層度量学習のための新しいミックスアップベースのデータ拡張法Metrixを紹介する。度量学習を例のペアの二値分類として扱うことで、Metrixは効果的なラベル補間を可能にし、4つのベンチマークデータセットで最先端の性能を達成する。これは埋め込み空間のカバー範囲の拡大と、未学習クラスへの一般化の向上に寄与する。

ABSTRACT

Metric learning involves learning a discriminative representation such that embeddings of similar classes are encouraged to be close, while embeddings of dissimilar classes are pushed far apart. State-of-the-art methods focus mostly on sophisticated loss functions or mining strategies. On the one hand, metric learning losses consider two or more examples at a time. On the other hand, modern data augmentation methods for classification consider two or more examples at a time. The combination of the two ideas is under-studied. In this work, we aim to bridge this gap and improve representations using mixup, which is a powerful data augmentation approach interpolating two or more examples and corresponding target labels at a time. This task is challenging because unlike classification, the loss functions used in metric learning are not additive over examples, so the idea of interpolating target labels is not straightforward. To the best of our knowledge, we are the first to investigate mixing both examples and target labels for deep metric learning. We develop a generalized formulation that encompasses existing metric learning loss functions and modify it to accommodate for mixup, introducing Metric Mix, or Metrix. We also introduce a new metric - utilization, to demonstrate that by mixing examples during training, we are exploring areas of the embedding space beyond the training classes, thereby improving representations. To validate the effect of improved representations, we show that mixing inputs, intermediate representations or embeddings along with target labels significantly outperforms state-of-the-art metric learning methods on four benchmark deep metric learning datasets.

研究の動機と目的

  • 分類におけるデータ拡張と度量学習の間のギャップを埋めるために、ミックスアップを拡張し、度量学習における入力とラベルの両方の補間を可能にする。
  • 度量学習における加法的でない損失関数が標準的なラベル補間を複雑にするという課題に対処する。
  • 訓練中に学習済みクラス以外の埋め込み空間領域を探索することで、未学習クラスへの一般化を向上させる。
  • テスト例が訓練例(クリーンまたは混合)とどの程度一致するかを定量化する新しい評価指標「利用度(utilization)」を導入する。
  • 統一的かつ汎用的なフレームワークを用いて、複数の深層度量学習ベンチマークで最先端の性能を達成する。

提案手法

  • 各ペアがアンカーに対して「正例」(同一クラス)または「負例」(異なるクラス)としてラベル付けされる例のペアに関する二値分類タスクとして度量学習を定式化する。
  • 入力特徴とペアの二値正例/負例ラベルの両方を補間することで、ミックスアップを度量学習に拡張する一般化されたフレームワークを提案する。
  • 混合例の「正性(positivity)」を補間係数αの関数として定義し、補間ラベルが正例と負例ペアの相対的寄与度を反映するように保証する。
  • テスト埋め込みから任意の訓練埋め込み(クリーンまたは混合)までの最小距離の平均を測定する新しい指標「利用度(utilization)」を導入する。利用度が低いほど、埋め込み空間のカバー範囲が良好であることを示す。
  • 入力レベル(元の画像)、中間レベル(特徴マップ)、埋め込みレベル(最終表現)の3段階でMetrixを適用し、一貫した性能向上を示す。
  • Metrixフレームワーク内では標準的な度量学習損失関数(例:対比損失、三重損失、マルチ類似損失)を用い、多様な損失タイプにおいてもその適合性と有効性を示している。

実験結果

リサーチクエスチョン

  • RQ1損失関数が個々の例に加法的でない度量学習において、ミックスアップを効果的に拡張できるか?
  • RQ2分類ラベルではなく正例/負例ペアを区別するタスクとしての度量学習では、ラベルをどのように補間すべきか?
  • RQ3訓練時に例とラベルを混合させることで、度量学習における未学習クラスへの一般化が向上するか?
  • RQ4利用度指標で測定した場合、ミックスアップによる探索が埋め込み空間のどの程度のカバー範囲を向上させるか?
  • RQ5Metrixは、複数のベンチマークデータセットと損失関数において一貫して最先端の手法を上回ることができるか?

主な発見

  • Metrixは、CUB200、Cars196、SOP、In-Shopの4つの深層度量学習ベンチマークで最先端の性能を達成し、Proxy Anchor や Proxy Synthesis といった先行手法を上回った。
  • 対比損失を用いたCUB200では、利用度が0.41から0.32に低下し、テストサンプルが埋め込み空間内で混合訓練例に近づいたことを示している。
  • マルチ類似損失(Wang et al., 2019)を用いたMetrixでは、4つのベンチマークすべてで新たな最先端結果を達成した。これは、この損失関数がミックスアップなしではSOTAではなかったにもかかわらずである。
  • 埋め込みレベルのミックスアップ(Metrix/embed)が最も高い向上を示し、In-ShopではR@1が80.6%に、100ショットリcallでは91.6%に上昇し、以前のSOTAを上回った。
  • 利用度指標は、ミックスアップが埋め込み空間のより包括的な探索をもたらし、テストクエリがクリーンな訓練例よりも混合訓練例に近づいていることを確認した。
  • 提案された正性関数は補間係数αとともに単調増加を示し、Metrixフレームワークにおけるラベル補間の理論的整合性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。