Skip to main content
QUICK REVIEW

[論文レビュー] Deep Metric Learning with Angular Loss

Jian Wang, Feng Zhou|arXiv (Cornell University)|Aug 4, 2017
Face recognition and analysis被引用数 4
ひとこと要約

本稿では、距離に基づく制約の代わりに三つ組の三角形における角度制約を導入する新しい深層度画像学習目的関数であるAngular Loss (AL) を提案する。これによりスケール変動に対するロバスト性が向上し、高次の幾何構造を捉えることができる。三つ組の負例点における角度を最小化することで、CUB-200-2011、Stanford Cars、Online Products データセットにおいて最先端の性能を達成し、再検索のリCALL@8 が最大83.9%、クラスタリング精度が61.1%に向上した。

ABSTRACT

The modern image search system requires semantic understanding of image, and a key yet under-addressed problem is to learn a good metric for measuring the similarity between images. While deep metric learning has yielded impressive performance gains by extracting high level abstractions from image data, a proper objective loss function becomes the central issue to boost the performance. In this paper, we propose a novel angular loss, which takes angle relationship into account, for learning better similarity metric. Whereas previous metric learning methods focus on optimizing the similarity (contrastive loss) or relative similarity (triplet loss) of image pairs, our proposed method aims at constraining the angle at the negative point of triplet triangles. Several favorable properties are observed when compared with conventional methods. First, scale invariance is introduced, improving the robustness of objective against feature variance. Second, a third-order geometric constraint is inherently imposed, capturing additional local structure of triplet triangles than contrastive loss or triplet loss. Third, better convergence has been demonstrated by experiments on three publicly available datasets.

研究の動機と目的

  • 距離に基づく度画像学習の限界、特にスケール変動への感受性と高次の幾何的制約の欠如を解消すること。
  • 三つ組損失における距離ベースの目的関数を角度ベースの制約に置き換えることで、学習の安定性と収束性を向上させること。
  • 三つ組における第三階の幾何構造を符号化することで、画像検索およびクラスタリングタスクの性能を向上させること。
  • スケールおよび回転不変な度画像学習目的関数を構築し、実世界のデータセットにおけるクラス内変動をよりよく扱えるようにすること。
  • N-pair損失などの既存フレームワークとの統合を通じて、Angular Lossの汎用性を示すこと。

提案手法

  • 三つ組の三角形における負例点における角度を制約する新しい損失関数を提案し、従来の距離ベースの制約に置き換える。
  • 正例および負例ベクトル間のなす角度のコサインを関数として定義し、分離を促すマージンを用いる。
  • 絶対的距離ではなく角度を用いることでスケール不変な目的関数を実現し、特徴量の大きさのばらつきに対する感受性を低減する。
  • 既存の度画像学習フレームワーク(例:N-pair損失)と組み合わせられる微分可能関数としてAngular Lossを実装する。
  • 負例が正例クラスタ中心から遠ざかるように、角度の上限に対するマージン制約を導入する。
  • 角度マージンを制御するハイパーパrameter α を導入し、アブレーションスタディにより最適な性能が α = 45° 時に得られることを示した。

実験結果

リサーチクエスチョン

  • RQ1三つ組の三角形における角度制約は、特徴マップにおけるスケール変動に対して深層度画像学習のロバスト性を向上させ得るか?
  • RQ2角度による第三階の幾何構造(三つ組の角度)を組み込むことで、第二階の距離ベースの目的関数に比べて収束性と性能が向上するか?
  • RQ3高クラス内変動を示すデータセット(例:Stanford Cars)において、Angular Loss は対照的損失および三つ組損失と比較して優れた性能を示すか?
  • RQ4N-pair損失などの既存の最先端の度画像学習フレームワークとAngular Lossを効果的に統合できるか?
  • RQ5異なるデータセット全体で最良の性能を得るために、角度マージン α の最適値は何か?

主な発見

  • CUB-200-2011 データセットでは、提案手法が83.9%のrecall@8を達成し、以前の最先端手法(NL&AL)の83.7%を上回った。
  • Stanford Cars データセットでは、92.1%のrecall@8 および63.2%のクラスタリング精度を達成し、すべてのベースラインを上回った。
  • Online Products データセットでは、98.0%のrecall@1000 および88.6%のクラスタリング精度を達成し、優れた一般化性能を示した。
  • アブレーションスタディの結果、Stanford Cars および Online Products データセットの両方で α = 45° 時に最良の性能が得られ、それぞれ83.9%および98.0%のrecall@1000 を達成した。
  • N-pair損失とAngular Lossの組み合わせ(NL&AL)が、すべてのデータセットで最高の性能を達成した。これにより、提案手法の有効性が確認された。
  • 特にクラス内変動が不均衡なデータセットにおいて、距離ベースのベースラインと比較して、収束性とロバスト性が優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。