Skip to main content
QUICK REVIEW

[論文レビュー] Team JL Solution to Google Landmark Recognition 2019

Yinzheng Gu, Chuanpeng Li|arXiv (Cornell University)|Jun 10, 2019
Advanced Image and Video Retrieval Techniques参考文献 14被引用数 8
ひとこと要約

この論文は、グーグルランドマーク認識2019コンペティションにおける上位パフォーマンスを達成するリtrievalベースのソリューションを提示している。グローバルおよびローカルCNN特徴量を組み合わせ、マルチステージの再ランク付けとアンサンブル戦略を適用することで、清浄化されたトレーニングデータ、マルチスケール記述子、反復的信頼度の最適化を活用し、プライベートリーダーボードで0.37606のGAPスコアを達成。最終的に、頑健な誤検出フィルタリングと信頼度キャリブレーションにより1位を獲得した。

ABSTRACT

In this paper, we describe our solution to the Google Landmark Recognition 2019 Challenge held on Kaggle. Due to the large number of classes, noisy data, imbalanced class sizes, and the presence of a significant amount of distractors in the test set, our method is based mainly on retrieval techniques with both global and local CNN approaches. Our full pipeline, after ensembling the models and applying several steps of re-ranking strategies, scores 0.37606 GAP on the private leaderboard which won the 1st place in the competition.

研究の動機と目的

  • 大規模ランドマーク認識における極端なクラス不均衡、ノイズの多いデータ、および誤検出が多様なテストセットの課題に対処すること。
  • 203,094クラスと400万枚のトレーニング画像を対象とした状況下で、分類モデルを上回る性能を発揮するリtrievalベースのシステムを開発すること。
  • トレーニングデータのクリーニングと反復的再ランク付けによる予測の最適化を通じて、モデルの汎化性能と信頼度キャリブレーションを向上させること。
  • ハイブリッドグローバル-ローカルCNNパイプラインを用いて、グーグルランドマーク認識2019コンペティションで最先端のパフォーマンスを達成すること。

提案手法

  • cosine類似度の閾値0.5を用いた記述子ベースのマッチングにより、視覚的に一貫性のないクラスを特定し、3枚以下という画像数の少ないクラスを削除することで、データクリーニングを実施した。
  • アテンションマップとプーリング操作(GeM、RMAC、MAC、SPoC)を用いたResNet-101、ResNeXt-101、SE-ResNet-101、SE-ResNeXt-101、SENet-154バックボーンを用いて、複数のグローバルCNNモデルを訓練した。
  • 複数のバックボーンからの記述子を連結し、次元削減のためにt=0.5を用いたアテンエートドアンサンブルホワイトニング(AUW)を適用した。
  • マージン0.9のコントラスト学習とマージン0.2のトリプレット損失を用い、1つのクエリ、1つのポジティブ、5つのハードネガティブ画像を含む10タプルのミニバッチで学習した。
  • テスト時推論のため、スケーリング要因(1/√2、1、√2)を用いたマルチスケール推論を実施し、記述子を和集合してℓ²正規化を適用した。
  • D2Rフレームワークを用いたローカルCNNモデルを統合し、学習された検出および埋め込みヘッドにより、細分化されたランドマークのリtrieval精度を向上させた。

実験結果

リサーチクエスチョン

  • RQ1大規模ランドマークデータセットにおける極端なクラス不均衡とノイズの多いデータは、どのように緩和可能か? これによりモデルの汎化性能がどのように向上するか?
  • RQ220万クラスを超えるオープンボリュームランドマーク認識において、リtrievalベースの手法は分類ベースのモデルをどの程度上回ることができるか?
  • RQ3マルチスケール特徴抽出と記述子統合は、長尾分布におけるリtrieval性能にどのような影響を及えるか?
  • RQ4反復的再ランク付けと信頼度キャリブレーション戦略は、誤検出画像における誤検出の低減にどの程度効果的か?

主な発見

  • 最終的なアンサンブルモデルは、プライベートリーダーボードで0.37606のGAPスコアを達成し、コンペティションで1位を獲得した。
  • データクリーニングと記述子ベースのフィルタリングの組み合わせにより、トレーニングセットが410万枚から836,964枚に削減され、クラス数は112,782に減少した。
  • 最良の単一モデル(Aggregate-7 top-5)は、プライベートリーダーボードで0.25138のGAPスコアを達成し、記述子統合の価値を示した。
  • SVMベースの誤検出フィルタリングステップ(ステップ2)により、プライベートリーダーボードのスコアは0.25138から0.29301に向上した。
  • N=550で実施されたマルチステージ再ランク付けプロセス(ステップ3)に加え、トップ1モデルスコアによる信頼度の最適化により、最終マージ前のスコアは0.36787にまで上昇した。
  • ステップ6とステップ3の結果を最終的にマージしたモデルが、最高のプライベートスコア0.37606を達成し、ニューラルネットワークベースの再ランク付けの代替手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。