[논문 리뷰] Team JL Solution to Google Landmark Recognition 2019
이 논문은 Google Landmark Recognition 2019 대회에서 최고 성능을 기록한 검색 기반 솔루션을 제시한다. 전역 및 국소 CNN 특징을 결합하고 다단계 재정렬 및 앙상블 전략을 적용하여, 정제된 학습 데이터, 다중 척도 기반 기술자, 반복적 신뢰도 보정을 활용해 사설 랜드마크 리더보드에서 0.37606의 GAP 스코어를 기록했으며, 최종적으로 강력한 가짜 대체물 필터링 및 신뢰도 校정을 통해 1등을 차지했다.
In this paper, we describe our solution to the Google Landmark Recognition 2019 Challenge held on Kaggle. Due to the large number of classes, noisy data, imbalanced class sizes, and the presence of a significant amount of distractors in the test set, our method is based mainly on retrieval techniques with both global and local CNN approaches. Our full pipeline, after ensembling the models and applying several steps of re-ranking strategies, scores 0.37606 GAP on the private leaderboard which won the 1st place in the competition.
연구 동기 및 목표
- 초기 클래스 불균형, 노이즈가 많은 데이터, 가짜 대체물이 많은 테스트 세트 등 대규모 랜드마크 인식 문제를 해결하기 위해.
- 203,094개의 클래스와 400만 장의 학습 이미지가 존재하는 상황에서 분류 모델을 능가하는 검색 기반 시스템을 개발하기 위해.
- 학습 데이터 정제와 반복적 재정렬을 통한 예측 보정을 통해 모델 일반화 능력과 신뢰도 보정을 향상시키기 위해.
- 하이브리드 전역-국소 CNN 파이프라인을 활용해 Google Landmark Recognition 2019 대회에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 전체 이미지 수 ≤3장인 클래스를 제거하고, 코사인 유사도 임계값 0.5를 사용한 기술자 기반 매칭을 통해 시각적으로 일관성 없는 클래스를 필터링하여 데이터 정제를 수행했다.
- ResNet-101, ResNeXt-101, SE-ResNet-101, SE-ResNeXt-101, SENet-154 백본을 사용하여 다수의 전역 CNN 모델을 훈련시켰으며, 주의 맵과 풀링 연산(예: GeM, RMAC, MAC, SPoC)을 적용했다.
- 다양한 백본에서 유도된 기술자를 연결(concatenation)하여 융합하고, 차원 감소를 위해 t=0.5로 설정된 감쇠된 무 supervision 화이트닝(AUW)을 적용했다.
- 마진 0.9의 대비 손실과 마진 0.2의 트리플릿 손실을 사용하여, 하나의 쿼리, 하나의 양성 샘플, 다섯 개의 하드 음성 샘플을 포함한 10개의 튜플로 이루어진 미니배치에서 훈련을 수행했다.
- 테스트 시기 추론을 위해 스케일링 인자(1/√2, 1, √2)를 사용한 다중 척도 추론을 적용하고, 기술자를 합산한 후 ℓ² 정규화를 수행했다.
- 학습된 탐지 및 임bedding 헤드를 갖춘 D2R 프레임워크를 사용한 국소 CNN 모델을 통합하여 미세한 랜드마크에 대한 검색 정확도를 향상시켰다.
실험 결과
연구 질문
- RQ1대규모 랜드마크 데이터셋에서 극심한 클래스 불균형과 노이즈가 많은 데이터를 어떻게 완화하여 모델 일반화 능력을 향상시킬 수 있는가?
- RQ220만 개 이상의 클래스를 가진 오픈-보기어 랜드마크 인식 환경에서 검색 기반 방법이 분류 기반 모델을 얼마나 능가할 수 있는가?
- RQ3다중 척도 기능 추출과 기술자 융합은 긴 尾 distribution에서 검색 성능에 어떤 영향을 미치는가?
- RQ4반복적 재정렬 및 신뢰도 보정 전략은 가짜 대체물 이미지에서의 오류 억제에 얼마나 효과적인가?
주요 결과
- 최종 앙상블 모델은 사설 리더보드에서 0.37606의 GAP 스코어를 기록하여 대회에서 1등을 차지했다.
- 데이터 정제와 기술자 기반 필터링을 통한 조치로 학습 세트가 410만 장에서 836,964장으로 감소했으며, 클래스 수는 112,782개로 축소되었다.
- 가장 우수한 단일 모델(Aggregate-7 top-5)은 사설 리더보드에서 0.25138의 GAP 스코어를 기록하여 기술자 융합의 가치를 입증했다.
- SVM 기반의 가짜 대체물 필터링 단계(Step-2)는 사설 리더보드 스코어를 0.25138에서 0.29301로 향상시켰다.
- N=550로 설정된 다단계 재정렬 프로세스(Step-3)와 상위 1개 모델 스코어를 통한 신뢰도 보정을 통해 스코어가 0.36787로 상승했으며, 최종 융합 이전 단계에서의 성능 향상이 이루어졌다.
- Step-6와 Step-3 결과를 최종 융합한 최종 모델은 0.37606의 최고 사설 스코어를 기록했으며, 신경망 기반 재정렬 대안보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.