Skip to main content
QUICK REVIEW

[論文レビュー] Deep Metric Learning with Spherical Embedding

Dingyi Zhang, Yingming Li|arXiv (Cornell University)|Nov 5, 2020
Face recognition and analysis参考文献 35被引用数 16
ひとこと要約

本論文では、深層度量学習における埋め込みノルムの分散を適応的に低減することで、埋め込みが同じ超球面上に位置することを保証する、新しい正則化手法である球面埋め込み制約(SEC)を提案する。訓練中の勾配更新を安定化させることで、方向に基づく最適化が向上し、顔認識、深層度量学習、自己教師あり学習のベンチマークにおいて顕著な性能向上が得られる。

ABSTRACT

Deep metric learning has attracted much attention in recent years, due to seamlessly combining the distance metric learning and deep neural network. Many endeavors are devoted to design different pair-based angular loss functions, which decouple the magnitude and direction information for embedding vectors and ensure the training and testing measure consistency. However, these traditional angular losses cannot guarantee that all the sample embeddings are on the surface of the same hypersphere during the training stage, which would result in unstable gradient in batch optimization and may influence the quick convergence of the embedding learning. In this paper, we first investigate the effect of the embedding norm for deep metric learning with angular distance, and then propose a spherical embedding constraint (SEC) to regularize the distribution of the norms. SEC adaptively adjusts the embeddings to fall on the same hypersphere and performs more balanced direction update. Extensive experiments on deep metric learning, face recognition, and contrastive self-supervised learning show that the SEC-based angular space learning strategy significantly improves the performance of the state-of-the-art.

研究の動機と目的

  • 埋め込みノルムの分布が深層度量学習における角距離最適化に与える影響を調査すること。
  • ミニバッチ最適化中に埋め込みノルムの分散が大きいために生じる勾配更新の不安定性を解消すること。
  • 埋め込みを共通の超球面上に制約することで、角損失関数における方向更新のバランスを改善すること。
  • 損失アーキテクチャを変更せずに、最先端の深層度量学習モデルの一般化性能と収束性を向上させること。

提案手法

  • 本研究では、各ミニバッチ内の埋め込みのL2ノルムを適応的に調整することで分散を低減する、球面埋め込み制約(SEC)を提案する。
  • SECは、ミニバッチ内のすべての埋め込みを、それらのL2ノルムの平均に等しい共通のノルムに正規化することで、超球面上での一様性を促進する。
  • 本手法は、アーキテクチャの変更を要せず、最終の埋め込み層の直後に適用される軽量で微分可能な正則化層として動作する。
  • SECは、三重項損失、Nペア損失、マルチ類似度損失などの既存のペアベースの角損失関数と統合され、訓練の安定性と性能が向上する。
  • 勾配逆伝播中に制約が適用されることで、初期ノルムが異なるサンプル間での勾配更新がバランスが取られる。
  • 本手法はノルムを定数に固定するのではなく、モデルの柔軟性を保ちつつ適応的正規化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1埋め込みノルムの分布は、角距離最適化における勾配の安定性と最適化効率にどのように影響するか?
  • RQ2埋め込みノルムの分散を低減することで、最先端の角損失関数の性能が向上するか?
  • RQ3埋め込みを共通の超球面上に制約することで、よりバランスの取れた方向更新と高速な収束が達成されるか?
  • RQ4SECは、顔認識や自己教師あり学習を含む多様なタスクにおいて、どの程度性能を向上させるか?
  • RQ5一般化性能と耐性の観点から、L2正則化などの他の正則化手法と比較して、SECはどのように差をつけるか?

主な発見

  • 図1に示すように、SECはトレーニング中に埋め込みノルムの分散を顕著に低減する。標準的な角損失と比較して、ノルム分布がはるかにきつい形状を示す。
  • CUB200-2011およびCars196データセットでは、SECにより三重項損失のトップ1正解率が最大1.5%向上し、全評価指標で一貫した向上が得られた。
  • LFW、MegaFace、CFPFPにおける顔認識タスクでは、SECにより最高性能を示すArcfaceモデルが99.35%の正解率に到達(SECなしでは99.32%)し、より大きなドリフトセットでもさらなる向上が得られた。
  • SimCLR自己教師あり学習におけるCIFAR-10およびCIFAR-100データセットでは、SECにより線形評価のトップ1正解率がベースラインのNT-Xentと比較して0.21~0.30ポイント向上した。
  • SECとマルチ類似度損失の組み合わせにより、10^6個のドリフトサンプルを含むMegaFaceで99.35%の正解率を達成し、ベースモデルおよびL2正則化変種を上回った。
  • SECは、評価されたすべての損失関数およびデータセットで一貫して性能向上を示し、多様な深層度量学習設定において一般化可能性と耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。