[論文レビュー] Deep Metric Learning by Online Soft Mining and Class-Aware Attention
本稿では、ミニバッチ内のすべてのサンプルに連続的なスコアを割り当てることで、有用な情報をフルに活用するとともに、外れ値の影響を軽減するため、オンラインソフトマイニング(OSM)とクラス認識注意(CAA)を提案する。OSMのソフトマイニングとCAAの外れ値抑制を組み合わせることで、細分化画像認識および動画ベースの人物再識別ベンチマークにおいて最先端の性能を達成し、MARSで最大4.9%のmAP向上を達成した。
Deep metric learning aims to learn a deep embedding that can capture the semantic similarity of data points. Given the availability of massive training samples, deep metric learning is known to suffer from slow convergence due to a large fraction of trivial samples. Therefore, most existing methods generally resort to sample mining strategies for selecting nontrivial samples to accelerate convergence and improve performance. In this work, we identify two critical limitations of the sample mining methods, and provide solutions for both of them. First, previous mining methods assign one binary score to each sample, i.e., dropping or keeping it, so they only selects a subset of relevant samples in a mini-batch. Therefore, we propose a novel sample mining method, called Online Soft Mining (OSM), which assigns one continuous score to each sample to make use of all samples in the mini-batch. OSM learns extended manifolds that preserve useful intraclass variances by focusing on more similar positives. Second, the existing methods are easily influenced by outliers as they are generally included in the mined subset. To address this, we introduce Class-Aware Attention (CAA) that assigns little attention to abnormal data samples. Furthermore, by combining OSM and CAA, we propose a novel weighted contrastive loss to learn discriminative embeddings. Extensive experiments on two fine-grained visual categorisation datasets and two video-based person re-identification benchmarks show that our method significantly outperforms the state-of-the-art.
研究の動機と目的
- 大規模データセットに含まれる自明なサンプルが引き起こす深層度画像学習の収束遅延を解消すること。
- 従来のサンプルマイニング手法がバイナリ(ハード)マイニングにより、有用なサンプルを破棄するという制限を克服すること。
- マイニングされた訓練サンプル内の外れ値がモデル性能を劣化させることの悪影響を軽減すること。
- 既存の度画像学習フレームワークと互換性がある汎用的でプラグイン可能なソリューションを開発すること。
- OSMとCAAを組み合わせた新しい重み付き対照損失を通じて、判別性の高い埋め込み学習を向上させること。
提案手法
- すべてのミニバッチ内サンプルに連続的なマイニングスコアを割り当てるオンラインソフトマイニング(OSM)を提案。バイナリ選択に代えて、バッチ内情報のフル活用を可能にする。
- 埋め込み空間におけるユークリッド距離に基づき、より類似したポジティブペアに高いスコアを割り当てるソフトポジティブマイニングを実装。クラス内ばらつきを保持する。
- 損失が大きいペアに高いスコアを割り当てることで、より困難なネガティブペアを優先するソフトネガティブマイニングを導入。ハードマイニングを一般化する。
- クラス適合性に基づいて注意スコアを計算するクラス認識注意(CAA)を提案。外れ値に低い注意重みを割り当てることで、抑制を実現。
- OSMスコアとCAA注意スコアの積としてペア重みを計算し、重み付き対照損失に統合。
- 本手法は汎用的であり、対照損失、三重項損失、四重項損失を用いる既存の度画像学習フレームワークに統合可能である。
実験結果
リサーチクエスチョン
- RQ1バイナリハードマイニングと比較して、連続的スコアによるマイニングが深層度画像学習におけるモデル収束と性能向上に寄与するか。
- RQ2ソフトポジティブマイニングによるクラス内ばらつきの保持は、細分化認識タスクにおける一般化性能の向上に寄与するか。
- RQ3外れ値が度画像学習の性能に及ぼす悪影響はどの程度で、訓練中に効果的に抑制可能か。
- RQ4ソフトマイニングと外れ値注意を統合した統一フレームワークが、多様なベンチマークデータセットで最先端の結果を達成できるか。
- RQ5OSMとCAAの統合は、画像ベースおよび動画ベースの人物再識別タスクの両方で性能にどのように影響を及けるか。
主な発見
- CUB-200-2011データセットでは、提案手法が77.5%のCMC-1精度を達成し、ベースラインより5.5ポイント向上した。
- MARSデータセットでは、最先端のCAE手法と比較して、mAPが4.9%向上し、CMC-1が2.3%向上した。
- より挑戦的なLPWデータセットでは、CMC-1が84.7%に達し、比較手法すべてを大きく上回った。
- アブレーションスタディにより、OSM単体でもベースライン比1〜2%の性能向上が確認され、CAAを追加することでさらに1〜2%の向上が得られた。
- 事前学習済みGoogleNet重みを用いても、ベースラインモデルはCMC-1が47.8%にとどまるが、提案手法はCUB-200-2011で7ポイント以上上回った。
- OSMとCAAの統合は、すべてのデータセットで一貫した向上を示し、堅牢性と一般化性能を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。