Skip to main content
QUICK REVIEW

[論文レビュー] Producing augmentation-invariant embeddings from real-life imagery

Sergio Manuel Papadakis, Sanjay Addicam|arXiv (Cornell University)|Dec 6, 2021
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

この論文では、ArcFace学習、アンサンブル学習、および2つのクエリ正規化手法を用いたCNNを用いた、増幅不変な画像埋め込みを生成する新規手法を提示する。合成的な増幅、マルチスケールバックボーン、段階的訓練方針を活用することで、Facebook AI Image Similarity Challengeの第2フェーズで0.59のマイクロ-平均適合率(micro-Average Precision)を達成し、2位を獲得した。

ABSTRACT

This article presents an efficient way to produce feature-rich, high-dimensionality embedding spaces from real-life images. The features produced are designed to be independent from augmentations used in real-life cases which appear on social media. Our approach uses convolutional neural networks (CNN) to produce an embedding space. An ArcFace head was used to train the model by employing automatically produced augmentations. Additionally, we present a way to make an ensemble out of different embeddings containing the same semantic information, a way to normalize the resulting embedding using an external dataset, and a novel way to perform quick training of these models with a high number of classes in the ArcFace head. Using this approach we achieved the 2nd place in the 2021 Facebook AI Image Similarity Challenge: Descriptor Track.

研究の動機と目的

  • ソーシャルメディアで一般的に見られる実世界の画像増幅に対して不変である、頑健な埋め込み空間の開発。
  • 大規模な画像類似性ベンチマークにおけるクラス不均衡とリファレンスセットへのアクセス制限の問題への対処。
  • 実画像から導出された合成的増幅を用いた訓練により、モデルの一般化性能の向上。
  • 外部の訓練データを用いてクエリ埋め込みを正規化し、類似度スコアの一貫性を向上。
  • 2021年Facebook AI Image Similarity Challenge Descriptor Trackで最先端のパフォーマンスを達成。

提案手法

  • 合成的増幅を用いて、複数のCNNバックボーン(EfficientNetV2、NFNet)をArcFaceヘッドとともに訓練し、訓練の多様性を向上。
  • 学習可能なpパラメータを有する一般化平均プーリング(GeM)を適用し、その後にバイアスのない線形層を介して256次元の埋め込みを生成。
  • 最終的な埋め込みにL2正規化を適用し、単位ベクトル表現を保証するとともに、類似度計算を改善。
  • クラス数を段階的に増加させるArcFaceヘッドを用いた段階的訓練戦略を採用し、収束を加速させ、一般化性能を向上。
  • 2つのクエリ正規化手法を提案:(1) 100個の近い訓練近傍から外側にクエリ埋め込みをスケーリングする方法、(2) 100個の最も近い訓練埋め込みから平均方向に沿って移動させる方法。
  • 異なるバックボーンと入力サイズを有する複数のモデルをアンサンブル平均化し、外部データセット(ImageNet、Deepfake Detection)を用いて訓練データを豊かにしたが、後日冗長性と訓練の不安定性のため、後者は却下された。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングモデルは、多様な実世界の画像増幅に対して不変な画像埋め込みを生成できるか?
  • RQ2深刻なクラス不均衡とリファレンスデータへのアクセス制限下でも、モデルの一般化性能をどのように向上できるか?
  • RQ3類似度スコアが異なる増幅に対して一貫性を保つために、クエリ埋め込みを正規化する最適な方法は何か?
  • RQ4アンサンブル学習と大規模なArcFaceヘッドを用いた段階的訓練は、大規模な画像類似性タスクにおいて顕著なパフォーマンス向上をもたらすか?
  • RQ5顔関連の画像増幅に対して、顔画像を含む外部データセットを用いることで、埋め込み品質が向上するか?

主な発見

  • 提案手法は、Facebook AI Image Similarity Challengeの第2フェーズで0.59のマイクロ-平均適合率(μAP)を達成し、2位を獲得した。
  • クエリ正規化手法2(100個の最も近い訓練埋め込みから平均方向に沿って移動)を適用することで、第2フェーズのμAPが0.53から0.59に向上した。
  • クラス数を段階的に増加させるArcFaceヘッドを用いた段階的訓練戦略により、高精度タスクでの収束が速まり、一般化性能が向上した。
  • 異なるバックボーンと入力サイズを有する複数のモデルのアンサンブルは、個々のモデルを上回る性能を示し、モデル多様性の有効性を示した。
  • ImageNetなどの外部データセットは訓練データの多様性を向上させたが、Deepfake Detectionデータセットは、高い冗長性と訓練の不安定性の影響のため、最終的に却下された。
  • リファレンスセットを訓練中に使用できないという制約にもかかわらず、最終モデルは未観測の増幅に対して強く一般化された性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。