Skip to main content
QUICK REVIEW

[論文レビュー] 2nd Place and 2nd Place Solution to Kaggle Landmark Recognition andRetrieval Competition 2019

Kaibing Chen, Cheng Cui|arXiv (Cornell University)|Jun 10, 2019
Advanced Image and Video Retrieval Techniques参考文献 17被引用数 6
ひとこと要約

この論文は、2019年Kaggleランドマーク認識およびリtrievalコンペティションの2位解決策を提示している。ハイブリッドリtrievalおよび認識システムを用い、複数の深層畳み込みニューラルネットワーク(DCNN)バックボーン(ResNet152、ResNet200、SE_ResNeXt152、InceptionV4)をArcMargin損失と組み合わせてグローバル特徴抽出を実施し、次にPCAを用いて次元削減を実施。さらに、変換に強い耐性を付けるために局所特徴マッチング(SURF、Hessian-Affine、SIFT)を統合。クエリ拡張、データベース拡張、認識スコアとリtrieval信頼度を用いたマルチステージ再ランク付けを実施し、プライベートスコア0.37469、パブリックスコア0.36365のGAPスコアを達成した。

ABSTRACT

We present a retrieval based system for landmark retrieval and recognition challenge.There are five parts in retrieval competition system, including feature extraction and matching to get candidates queue; database augmentation and query extension searching; reranking from recognition results and local feature matching. In recognition challenge including: landmark and non-landmark recognition, multiple recognition results voting and reranking using combination of recognition and retrieval results. All of models trained and predicted by PaddlePaddle framework. Using our method, we achieved 2nd place in the Google Landmark Recognition 2019 and 2nd place in the Google Landmark Retrieval 2019 on kaggle. The source code is available at here.

研究の動機と目的

  • 大規模ランドマークデータセット向けに高精度な画像リtrievalおよび認識システムの開発。
  • スケール、回転、視点の変化に対して一般化性と耐性を向上させる。
  • 400万枚のトレーニング画像、100万枚のインデックス画像を含む大規模データを効果的な特徴学習と効率的な検索で処理する課題の解決。
  • グローバル特徴と局所特徴の統合、クエリ拡張、データベース拡張を通じてリtrieval性能の向上。
  • GoogleランドマークデータセットV2におけるランドマーク認識およびリtrievalの両タスクでトップクラスのパフォーマンスを達成すること。

提案手法

  • ArcMargin損失を用いて微調整した4つの深層畳み込みニューラルネットワーク(DCNN)バックボーン(ResNet152、ResNet200、SE_ResNeXt152、InceptionV4)を用い、判別的なグローバル特徴抽出を実施。
  • 平均プーリング後の最初の全結合層から画像記述子を抽出し、次に次元削減のためPCAを適用して次元を512に削減。
  • 複数のグローバル記述子を連結し、k-NN検索を用いて候補リtrievalを実施。
  • SURF、Hessian-Affine、SIFTを用いた局所特徴マッチングを、効率的な最近傍探索のためのインverted indexと統合。
  • ステージ2のインデックスデータに対してクラスタリングを用いて、クエリ拡張およびデータベース拡張を実施し、トレーニングおよび検索のカバレッジを拡大。
  • 認識信頼度、リtrievalスコア、および頻度ベースのテクニック(頻出ランドマーク(Wセット))を用いたマルチステージ再ランク付けを実施し、ノイズを低減。

実験結果

リサーチクエスチョン

  • RQ1ArcMargin損失を用いた深層畳み込みニューラルネットワーク(DCNN)は、大規模データセットにおけるランドマークリtrievalのグローバル特徴表現をどのように向上させるか?
  • RQ2SURF、SIFT、Hessian-Affineを用いた局所特徴マッチングは、幾何的変換に対してどれほどリtrievalの耐性を高めるか?
  • RQ3クラスタリングを用いたクエリ拡張およびデータベース拡張は、リtrieバルカバレッジと正確性を向上させるのにどれほど有効か?
  • RQ4マルチモデル統合と反復的再ランク付けは、ランドマークベンチマークにおける認識およびリtrievalパフォーマンスを顕著に向上させるか?
  • RQ5頻度ベースの再スコアリングは、誤検出を低減させ、GAPスコアを向上させるのにどのような影響を及えるか?

主な発見

  • 本システムは、Kaggle 2019コンペティションのランドマーク認識およびリtrieバルの両トラックで2位を達成した。
  • 上位ランクの画像に対して頻度ベースの再スコアリングを適用した後、プライベートGAPスコアは0.37469、パブリックGAPスコアは0.36365に到達した。
  • A1B1、A1B2、A2B1、A2B2、A3B1、A3B2の各カテゴリでランドマーク頻度に基づく再スコアリングを実施した頻度ベースのテクニックにより、GAPスコアは0.35988から0.37469に向上した。
  • 複数のCNNバックボーンをArcMargin損失と組み合わせ、PCAを用いることで、特徴次元を削減しながらも判別力は維持された。
  • グローバル特徴と局所特徴(SURF、Hessian-Affine、SIFT)を統合することで、変形が強い難易度の高いサンプルにおける性能が顕著に向上した。
  • すべてのグレードカテゴリに頻度ベースの再スコアリングを拡張したことで、最終モデルはプライベートGAPスコア0.38231、パブリックGAPスコア0.36805を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。