Skip to main content
QUICK REVIEW

[論文レビュー] Attention-based Ensemble for Deep Metric Learning

Wonsik Kim, Bhavya Goyal|arXiv (Cornell University)|Apr 2, 2018
Advanced Image and Video Retrieval Techniques参考文献 34被引用数 22
ひとこと要約

本論文は、異なる注目マスクを用いて複数の学習器を訓練することで、モデルの多様性を向上させる注目ベースのアンサンブル(ABE-M)を提案する。各学習器が画像の異なる領域に注目するように設計され、注目特徴の類似性を低減するための分散損失を導入することで、より高い特徴の多様性を実現している。ABE-Mは、CARS-196、CUB-200-2011、SOP、in-shop クロージングリtrievalベンチマークで最先端の性能を達成しており、ベースラインのアンサンブルと比較してパラメータ数が少ない。

ABSTRACT

Deep metric learning aims to learn an embedding function, modeled as deep neural network. This embedding function usually puts semantically similar images close while dissimilar images far from each other in the learned embedding space. Recently, ensemble has been applied to deep metric learning to yield state-of-the-art results. As one important aspect of ensemble, the learners should be diverse in their feature embeddings. To this end, we propose an attention-based ensemble, which uses multiple attention masks, so that each learner can attend to different parts of the object. We also propose a divergence loss, which encourages diversity among the learners. The proposed method is applied to the standard benchmarks of deep metric learning and experimental results show that it outperforms the state-of-the-art methods by a significant margin on image retrieval tasks.

研究の動機と目的

  • モデルアンサンブルを用いた特徴の多様性を高めることで、深層度量学習の性能を向上させること。
  • アンサンブルメンバー間の特徴埋め込みに多様性を生じさせるためのアーキテクチャ設計の欠如を是正すること。
  • モデルサイズを小さく抑えながらも高い性能を維持できる、パラメータ効率の良いアンサンブルフレームワークを開発すること。
  • 注目ベースの注目マスクと分散損失が、個々のモデルとアンサンブルモデルの両方の性能を向上させることを検証すること。

提案手法

  • 本手法は、共有バックボーンネットワークを用い、M個の別個の注目モジュールを持つM方向の注目ベースのアンサンブル(ABE-M)を採用する。各注目モジュールは、入力画像の異なる空間的領域に注目するように学習する。
  • 各注目モジュールは、物体の異なる部分に注目することで、固有の特徴表現を生成し、学習された埋め込みの多様性を促進する。
  • 異なる学習器の注目マップ間の類似性を明示的に低減するため、分散損失を導入する。これにより、各学習器が異なる画像領域に注目するよう促進される。
  • 標準的な度量学習損失(例:トリプレット損失や対照的損失)と、提案された分散損失を組み合わせ、エンドツーエンドでフレームワークを訓練する。
  • すべての学習器に共通する初期畳み込み層を共有することで、パラメータ数を削減しながらも高い性能を維持する。
  • 本手法は、CARS-196、CUB-200-2011、SOP、in-shop クロージングリtrievalを含む標準ベンチマークで評価されている。

実験結果

リサーチクエスチョン

  • RQ1複数の学習器で注目ベースの特徴選択をすることで、深層度量学習の性能が向上するか?
  • RQ2注目マップの多様性を明示的に促進することで、一般化性能とリtrieval精度が向上するか?
  • RQ3注目モジュールを備えた共有バックボーンアンサンブルは、パラメータ数を減らしながらも、標準的なMヘッドアンサンブルを上回る性能を示せるか?
  • RQ4提案された分散損失は、個々の学習器の性能とアンサンブルの精度の両方を向上させるか?

主な発見

  • ABE-8(512次元特徴)は、in-shop クロージングリtrievalデータセットでRecall@50が98.7%を達成し、以前の最先端手法A-BIERを0.3%上回った。
  • CUB-200-2011(クロップド)では、ABE-8がRecall@30で92.2%を達成し、A-BIER(92.1%)とMargin(90.6%)を上回った。
  • SOPでは、ABE-8がRecall@1000で98.2%を達成し、A-BIER(97.8%)とMargin(98.0%)を上回った。
  • CARS-196(クロップド)では、ABE-8がRecall@8で95.5%を達成し、A-BIER(95.6%)とHDC(93.8%)を上回った。
  • 提案されたABE-4およびABE-8モデルは、Mヘッドベースラインと比較して高い性能を示したが、パラメータ数は少ない。
  • 分散損失は、個々のモデルの性能とアンサンブルの精度の両方を向上させ、特徴の多様性を促進する有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。