Skip to main content
QUICK REVIEW

[論文レビュー] A Theoretically Sound Upper Bound on the Triplet Loss for Improving the Efficiency of Deep Distance Metric Learning

Thanh-Toan Do, Toan Tran|arXiv (Cornell University)|Apr 18, 2019
Advanced Image and Video Retrieval Techniques参考文献 48被引用数 8
ひとこと要約

本論文は、深層距離メトリック学習における三重損失の理論的裏付けされた線形時間計算量の上界を提案し、O(N³)からO(N)の時間計算量にまで低減することで、トレーニングを高速化する。クラスの重心を用いて三重損失をきめ細かく上界で抑え、最先端の三重損失手法と比較して10倍速いトレーニングを実現しながら、CUB-200-2011およびCAR196データセットで競争力ある検索精度を維持する。

ABSTRACT

We propose a method that substantially improves the efficiency of deep distance metric learning based on the optimization of the triplet loss function. One epoch of such training process based on a naive optimization of the triplet loss function has a run-time complexity O(N^3), where N is the number of training samples. Such optimization scales poorly, and the most common approach proposed to address this high complexity issue is based on sub-sampling the set of triplets needed for the training process. Another approach explored in the field relies on an ad-hoc linearization (in terms of N) of the triplet loss that introduces class centroids, which must be optimized using the whole training set for each mini-batch - this means that a naive implementation of this approach has run-time complexity O(N^2). This complexity issue is usually mitigated with poor, but computationally cheap, approximate centroid optimization methods. In this paper, we first propose a solid theory on the linearization of the triplet loss with the use of class centroids, where the main conclusion is that our new linear loss represents a tight upper-bound to the triplet loss. Furthermore, based on the theory above, we propose a training algorithm that no longer requires the centroid optimization step, which means that our approach is the first in the field with a guaranteed linear run-time complexity. We show that the training of deep distance metric learning methods using the proposed upper-bound is substantially faster than triplet-based methods, while producing competitive retrieval accuracy results on benchmark datasets (CUB-200-2011 and CAR196).

研究の動機と目的

  • データセットサイズに比例してO(N³)に増加する三重損失トレーニングの高い計算量を低減すること。
  • 重心最適化に起因するO(N²)の計算量を有する従来のサブサンプリングおよび重心ベースの手法の限界を克服すること。
  • クラスの重心を用いて理論的裏付けがありきめ細かい三重損失の上界を導出し、線形時間トレーニングを可能にすること。
  • トレーニング中に繰り返し重心最適化を実行する必要を排除し、性能を損なうことなく保証された線形時間計算量を達成すること。
  • オープンワールドおよび生涯学習の応用に適した効率的かつスケーラブルな深層メトリック学習を実現すること。

提案手法

  • クラスの重心を用いて、標準的な三重損失の理論的裏付けがありきめ細かい上界となる判別的損失関数を提案する。
  • クラスの重心が十分に分離されており、均等に分布している場合、上界と真の三重損失との差が0に近づくことを証明する。
  • 上界のきめ細かさを保証する2つのクラス重心の生成手法を導入:1つは特徴量の経験的平均に基づくもの、もう1つは固定回数の反復による最適化を用いるもの。
  • トレーニング中にクラス重心を固定するトレーニングアルゴリズムを設計し、従来の手法で必要とされるO(N²)の重心更新ステップを排除する。
  • GoogleNet や VGG-16 などのさまざまなバックボーンネットワークと互換性を持つように、最小限のアーキテクチャ変更で提案損失を深層ニューラルネットワークに統合する。
  • 三重損失の立方体計算を、サンプルと重心の線形スキャンに置き換えることで、1エポックあたりO(N)の時間計算量を達成する。

実験結果

リサーチクエスチョン

  • RQ1理論的裏付けがあり、元の損失の最小化を保証するが、同時に線形時間トレーニングを可能にする三重損失の上界を導出できるか?
  • RQ2クラス重心の分布にどのような条件を満たせば、上界がきめ細かくなり、メトリック学習に有効となるか?
  • RQ3重心ベースのメトリック学習における高コストな重心最適化ステップを、性能を落とさずに排除できるか?
  • RQ4提案手法は、最先端の三重損失ベース手法と比較して、著しく高速なトレーニングと競争力ある検索精度を両立できるか?
  • RQ5実際のデータセットサイズやクラス数の増加に伴って、提案手法はどのようにスケーリングするか?

主な発見

  • 提案された判別的損失は、CUB-200-2011およびCAR196データセットにおいて、スマートマイニングを用いた最先端の三重損失手法と比較して、それぞれ約13〜17倍の高速トレーニングを達成した。
  • トレーニングサンプル数およびクラス数に対して線形スケーリングを示し、理論的なO(N)計算量の主張を裏付ける。
  • CUB-200-2011データセットでは、VGG-16を用いてR@1精度57.74%を達成し、同じ損失関数を用いたGoogleNetと比較して6.3%の向上を示した。
  • CAR196データセットでは、VGG-16を用いてR@1精度78.15%を達成し、GoogleNetと比較して9.8%の向上を示した。
  • クラス重心が十分に分離されており、それらの間の距離が類似している場合、三重損失の上界がきめ細かいことが証明された。
  • 実験結果により、提案された上界の最小化が競争力ある検索性能をもたらすことが確認され、理論的裏付けの妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。