Skip to main content
QUICK REVIEW

[論文レビュー] Noise-resistant Deep Metric Learning with Ranking-based Instance Selection

Chang Liu, Han Yu|arXiv (Cornell University)|Mar 30, 2021
Advanced Image and Video Retrieval Techniques参考文献 7被引用数 6
ひとこと要約

本稿では、メモリーバンクを用いてトレーニング中にノイジーサンプルを特定・フィルタリングする確率的ランクベースのインスタンス選択を組み合わせた、ノイズに強い深層度画像学習手法PRISMを提案する。複数のネットワークスナップショットにおける特徴類似度を活用することで、モデルのロバスト性が向上し、既存手法と比較してラベルノイズ下で最大6.06%高いPrecision@1を達成する。

ABSTRACT

The existence of noisy labels in real-world data negatively impacts the performance of deep learning models. Although much research effort has been devoted to improving robustness to noisy labels in classification tasks, the problem of noisy labels in deep metric learning (DML) remains open. In this paper, we propose a noise-resistant training technique for DML, which we name Probabilistic Ranking-based Instance Selection with Memory (PRISM). PRISM identifies noisy data in a minibatch using average similarity against image features extracted by several previous versions of the neural network. These features are stored in and retrieved from a memory bank. To alleviate the high computational cost brought by the memory bank, we introduce an acceleration method that replaces individual data points with the class centers. In extensive comparisons with 12 existing approaches under both synthetic and real-world label noise, PRISM demonstrates superior performance of up to 6.06% in Precision@1.

研究の動機と目的

  • 深層度画像学習におけるラベルノイズ下でのロバストな手法の不足という、ノイズ耐性分類の進展にもかかわらず依然として深刻なギャップを解消すること。
  • 手動ラベル付けやクラス遷移行列に依存せずに、トレーニング中のノイジーサンプルを特定する手法を開発すること。
  • 複数のネットワークスナップショットからの履歴に依存する動的で履歴認識型類似度スコアを用いて、ノイジーサンプルをフィルタリングすることで、度画像学習の一般化性能を向上させること。
  • クラス中心近似を用いることでメモリベースのフィルタリングの計算コストを低減しつつ、性能を維持すること。
  • 合成的・実世界的・オープンセットノイズのシナリオを含む多様なノイズ設定において有効性を示し、新規のスモールクラスターノイズモデルを含むこと。

提案手法

  • PRISMは、過去のネットワーク重みからの特徴を用いて、データポイントとメモリーバンク内の他のサンプルとの平均類似度から、ラベルがクリーンである確率を計算する。
  • 本手法は、複数の過去のトレーニングイテレーションからの特徴を格納するメモリーバンクを維持し、モデル状態間での比較を可能にする。
  • 確率的ランク関数 $ P_{\text{clean}}(i) $ は、メモリーバンク内での同じクラスに属する他のサンプルとの類似度に基づいて、インスタンスをランク付けする。
  • スムーズなトップ-R(sTRM)トリックは、トレーニングイテレーションにわたるスライディングウインドウを用いて、ノイジーサンプルを特定するためのしきい値を動的に調整する。
  • 加速技術では、類似度計算において個々のデータポイントの代わりにクラス中心を用いることで、SOPデータセットで最大6.9倍の計算削減が可能となる。
  • 本手法はメモリーバンクおよびクラス中心ベースのトレーニングの両方と互換性があり、柔軟性とスケーラビリティを実現する。
Figure 1 : Example images in CARS-98N. Images in the first row have clean labels. The second row shows some images with noisy labels, including car interiors and car parts.
Figure 1 : Example images in CARS-98N. Images in the first row have clean labels. The second row shows some images with noisy labels, including car interiors and car parts.

実験結果

リサーチクエスチョン

  • RQ1メモリ拡張型で類似度ベースの手法は、クラス遷移行列に依存せずに、深層度画像学習におけるノイジーサンプルを効果的に検出できるか?
  • RQ2単一イテレーションの特徴と比較して、複数の過去のネットワーク重みを用いることで、ノイジーサンプル検出の信頼性はどの程度向上するか?
  • RQ3類似度計算において個々のデータポイントをクラス中心に置き換えることで、計算コストはどの程度低減できるか?その際、性能の劣化は生じないか?
  • RQ4PRISMは、対称的ノイズ、オープンセットノイズ、実世界のラベルノイズなど、多様なノイズ設定下でどの程度の性能を示すか?
  • RQ5ノイジーサンプルを特定する最適なしきい値戦略は何か?また、sTRMトリックはノイズデータに対するロバスト性をどのように向上させるか?

主な発見

  • PRISMは、対称的ノイズおよび実世界のラベルノイズ下で、12の既存DMLおよびノイズ耐性トレーニング手法と比較して、最大6.06%高いPrecision@1を達成する。
  • 25%のスモールクラスターノイズを含むCARSデータセットでは、PRISMはPrecision@1が75.40%、MAP@Rが17.40%を達成し、ベースラインのフィルタリング戦略を上回る。
  • sTRM加速技術により、SOPデータセットではトレーニング時間を6.9倍短縮しつつ、高い性能を維持した。
  • PRISMの最適なフィルタリングレート $ R = 50\% $ は、CARS-98Nデータセットにおける推定50%のラベルノイズ率に対応する。
  • アブレーションスタディの結果、メモリーバンク全体(Memory-positive)を用いる方がバッチ内類似度(Batch-positive)よりも効果的であり、PRISMの完全な定式化(式2)が最良の性能を示した。
  • PRISM下でのモデル性能は安定的で、時間経過とともに向上するが、ノイズ条件下で5,000イテレーションを過ぎると過学習を起こし劣化するベースラインとは対照的である。
Figure 2 : The Precision@1 (%) vs number of iterations on CARS with 25% Small Cluster Noise.
Figure 2 : The Precision@1 (%) vs number of iterations on CARS with 25% Small Cluster Noise.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。