[논문 리뷰] 3rd Place Solution to Google Landmark Recognition Competition 2021
이 논문은 2021년 구글 랜드마크 인식 경쟁에서 3위를 차지한 솔루션을 제시하며, 특징 임bedding을 위해 다중 아키텍처 모델(CNN, Transformer, 하이브리드)과 ArcFace 손실을 활용한다. 이 방법은 검색 점수, 분류 로짓, 가짜 랜드마크 점수 페널티, 및 1위 분류 앙상블을 통합한 재정렬 파이프라인을 적용하여 사설 랜드마크 리더보드에서 0.48962의 점수를 기록했다.
In this paper, we show our solution to the Google Landmark Recognition 2021 Competition. Firstly, embeddings of images are extracted via various architectures (i.e. CNN-, Transformer- and hybrid-based), which are optimized by ArcFace loss. Then we apply an efficient pipeline to re-rank predictions by adjusting the retrieval score with classification logits and non-landmark distractors. Finally, the ensembled model scores 0.489 on the private leaderboard, achieving the 3rd place in the 2021 edition of the Google Landmark Recognition Competition.
연구 동기 및 목표
- 대규모이고 불균형한 데이터셋에서 내부 클래스 변동성이 크고 랜드마크가 아닌 이미지가 포함된 경우의 인스턴스 수준 랜드마크 인식 문제를 해결하기 위해.
- 다양한 모델 아키텍처(CNN, Transformer, 하이브리드)를 조합하여 상보적인 특징 학습을 통해 검색 정확도를 향상시키기 위해.
- 분류 로짓 통합 및 랜드마크가 아닌 유사도 기반 예측 페널티를 통해 예측 신뢰도를 향상시키기 위해.
- 정규화된 임베딩 연결 및 엔드 투 엔드 재정렬을 통한 모델 앙상블 최적화를 위해.
- 강력하고 확장 가능한 파이프라인을 통해 2021년 구글 랜드마크 인식 대회에서 최고 성능을 달성하기 위해.
제안 방법
- EfficientNet-B5/B6/B7/V2(CNN), Swin-L-384(Transformer), CvT-W24-384(하이브리드)를 사용해 다수의 백본에서 512D 이미지 임베딩을 추출하였다.
- CNN의 경우 GeM 풀링을, Transformer의 경우 직접 토큰 풀링을 사용해 ArcFace 손실을 통해 임베딩을 최적화하였으며, 적응형 마진을 적용하였다.
- 다단계 학습 스케줄을 적용: 먼저 GLDv2c(150만 장, 81,000개 클래스), 그 다음 GLDv2x(320만 장), 마지막으로 GLDv2(410만 장, 203,000개 클래스)에서 백본은 고정하고 헤드만 미세조정하였다.
- 해상도 스케일링과 코즈인 애너일링을 통한 학습률 감소를 고려한 데이터 증강(RandAug, CutOut, RandomResizedCrop)을 적용하였다.
- 재정렬 파이프라인을 구현: 랜드마크가 아닌 매칭에서의 가짜 랜드마크 점수를 빼고 분류 로짓을 더해 검색 점수를 조정하였다.
- 임베딩을 L2 정규화한 후 앙상블링하여 결합된 공간에서 전체 추론 파이프라인을 다시 실행하였다.
실험 결과
연구 질문
- RQ1다양한 모델 아키텍처(CNN, Transformer, 하이브리드)를 효과적으로 조합하여 랜드마크 검색 성능을 향상시킬 수 있는가?
- RQ2희귀 랜드마크(학습 예제가 적은 경우)에서 분류 로짓이 검색 정확도에 얼마나 기여하는가?
- RQ3랜드마크가 아닌 이미지 간 유사도 점수를 효과적인 페널티 메커니즘으로 활용할 수 있는가?
- RQ4검색 및 가짜 랜드마크 조정과 결합했을 때, 1위 분류 로짓 앙상블이 최종 예측에 어떻게 향상되는가?
- RQ5일반화 및 새로운 랜드마크에 대한 일반화를 극대화하기 위해 최적의 학습 스케줄 및 데이터 분할 전략은 무엇인가?
주요 결과
- Swin-L-384 모델이 공개 리더보드에서 0.383의 최고 검색 점수를 기록하여 모든 CNN 기반 모델을 능가했다.
- Swin-L과 CvT-W24-384를 앙상블했을 때 CNN 모델만 앙상블한 것보다 더 큰 성능 향상을 기록하여 강력한 아키텍처 보완성이 입증되었다.
- 최종 모델은 사설 리더보드에서 0.48962의 점수를 기록하여 대회에서 3위를 차지했다.
- 분류 로짓 조정은 희귀 랜드마크에서 특히 유의미한 향상을 가져왔으며, B5 모델은 공개 리더보드에서 약 0.39의 1위 정확도를 달성했다.
- 가짜 랜드마크 점수 페널티는 랜드마크가 아닌 이미지에서의 오답 예측을 효과적으로 줄여 검색의 강건성을 향상시켰다.
- 1위 분류 로짓 앙성은 가짜 랜드마크 페널티 없이도 추가적인 성능 향상을 가져왔는데, 이는 자연스럽게 랜드마크가 아닌 예측을 억제하는 능력 때문이었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.