Skip to main content
QUICK REVIEW

[論文レビュー] 3rd Place Solution to Google Landmark Recognition Competition 2021

Cheng Xu, Weimin Wang|arXiv (Cornell University)|Oct 6, 2021
Domain Adaptation and Few-Shot Learning参考文献 13被引用数 4
ひとこと要約

この論文は、2021年Google Landmark Recognition コンペティションにおける3位のソリューションを提示しており、特徴埋め込みにArcFace損失を用いたマルチアーキテクチャモデル(CNN、Transformer、ハイブリッド)を活用している。この手法は、検索スコア、分類スコア、誤検出スコアのペナルティ、およびトップ1分類スコアの集約を組み合わせたリランクパイプラインを採用し、プライベートリーダーボードで0.48962のスコアを達成した。

ABSTRACT

In this paper, we show our solution to the Google Landmark Recognition 2021 Competition. Firstly, embeddings of images are extracted via various architectures (i.e. CNN-, Transformer- and hybrid-based), which are optimized by ArcFace loss. Then we apply an efficient pipeline to re-rank predictions by adjusting the retrieval score with classification logits and non-landmark distractors. Finally, the ensembled model scores 0.489 on the private leaderboard, achieving the 3rd place in the 2021 edition of the Google Landmark Recognition Competition.

研究の動機と目的

  • 大規模で不均衡なデータセットにおけるインスタンスレベルのランドマーク認識を解決すること。
  • CNN、Transformer、ハイブリッドの多様なモデルアーキテクチャを組み合わせることで、補完的な特徴学習を実現し、検索精度を向上させること。
  • 分類スコアの統合と非ランドマーク類似度に基づく予測のペナルティ処理により、予測の信頼性を向上させること。
  • 正規化された埋め込みの連結とエンドツーエンドのリランクを用いたモデルアンサンブルの最適化。
  • 強固でスケーラブルなパイプラインを用いて、Google Landmark Recognition 2021 コンペティションで最先端のパフォーマンスを達成すること。

提案手法

  • EfficientNet-B5/B6/B7/V2(CNN)、Swin-L-384(Transformer)、CvT-W24-384(ハイブリッド)の複数のバックボーンを用いて、512次元の画像埋め込みを抽出した。
  • CNNではGeMプーリングを、Transformerでは直接トークンプーリングを用い、適応的マージンを用いたArcFace損失により埋め込みを最適化した。
  • マルチステージのトレーニングスケジュールを適用:まずGLDv2c(150万枚の画像、8万1千クラス)で、次にGLDv2x(320万枚)、最後にGLDv2(410万枚、20万3千クラス)で、バックボーンを固定し、ヘッドのみを微調整した。
  • データオーグメンテーション(RandAug、CutOut、RandomResizedCrop)を実施し、解像度スケーリングとコサインアニーリングによる学習率の減少を適用した。
  • リランクパイプラインを実装:非ランドマークマッチの類似度スコアを差し引いたり、分類スコアを加算することで、検索スコアを調整した。
  • モデルアンサンブルは、L2正規化された埋め込みを連結し、結合された埋め込み空間で再び全パイプラインを実行することで実現した。

実験結果

リサーチクエスチョン

  • RQ1CNN、Transformer、ハイブリッドの多様なモデルアーキテクチャを効果的に組み合わせることで、ランドマーク検索性能をどのように向上させられるか?
  • RQ2分類スコアの調整は、訓練例が少ないレアランドマークにおいて、検索精度をどの程度向上させるか?
  • RQ3非ランドマーク画像の類似度スコアを、誤検出を低減する有効なペナルティ機構として利用できるか?
  • RQ4リトライバルと誤検出調整と組み合わせた際、トップ1分類スコアの集約は、最終予測をどの程度向上させるか?
  • RQ5一般化性能と未学習のランドマークへの一般化を最大化するための、最適なトレーニングスケジュールとデータパーティショニング戦略は何か?

主な発見

  • Swin-L-384モデルは、パブリックリーダーボードで0.383の最高検索スコアを記録し、すべてのCNNベースのモデルを上回った。
  • Swin-LとCvT-W24-384のアンサンブルは、CNNモデル同士のアンサンブルよりも顕著な性能向上を示し、強力なアーキテクチャの補完性を示した。
  • 最終モデルは、プライベートリーダーボードで0.48962のスコアを達成し、コンペティションで3位となった。
  • 分類スコアの調整により、特に低頻度のランドマークに対して予測が向上し、B5モデルではパブリックLBで約0.39のトップ1精度を達成した。
  • 誤検出スコアのペナルティ処理により、非ランドマーク画像における誤検出が効果的に低減され、検索のロバスト性が向上した。
  • トップ1分類スコアの集約は、誤検出ペナルティがなくても、非ランドマーク予測を自然に抑制する能力があるため、追加の性能向上をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。