Skip to main content
QUICK REVIEW

[논문 리뷰] 2nd Place and 2nd Place Solution to Kaggle Landmark Recognition andRetrieval Competition 2019

Kaibing Chen, Cheng Cui|arXiv (Cornell University)|2019. 06. 10.
Advanced Image and Video Retrieval Techniques참고 문헌 17인용 수 6
한 줄 요약

이 논문은 2019년 캐글 랜드마크 인식 및 검색 경쟁에서 2위를 차지한 솔루션을 제시한다. 하이브리드 검색 및 인식 시스템을 사용하여, 전역 특징 추출을 위해 다수의 딥 컨volution 네트워크 백본(ResNet152, ResNet200, SE_ResNeXt152, InceptionV4)과 ArcMargin 손실을 조합하고, 차원 감소를 위해 PCA를 사용하며, 변환에 대한 강건성을 확보하기 위해 국소 특징 매칭(SURF, Hessian-Affine, SIFT)을 적용한다. 쿼리 확장, 데이터베이스 증강, 그리고 인식 점수와 검색 신뢰도를 활용한 다단계 재정렬을 통해, 사설 GAP 스코어 0.37469와 공개 GAP 스코어 0.36365를 달성한다.

ABSTRACT

We present a retrieval based system for landmark retrieval and recognition challenge.There are five parts in retrieval competition system, including feature extraction and matching to get candidates queue; database augmentation and query extension searching; reranking from recognition results and local feature matching. In recognition challenge including: landmark and non-landmark recognition, multiple recognition results voting and reranking using combination of recognition and retrieval results. All of models trained and predicted by PaddlePaddle framework. Using our method, we achieved 2nd place in the Google Landmark Recognition 2019 and 2nd place in the Google Landmark Retrieval 2019 on kaggle. The source code is available at here.

연구 동기 및 목표

  • 대규모 랜드마크 데이터셋을 위한 고정확도의 이미지 검색 및 인식 시스템을 개발하기 위해.
  • 크기, 회전, 시점 변화에 대응하는 일반화 및 강건성을 향상시키기 위해.
  • 400만 개의 훈련 이미지, 100만 개의 인덱스 이미지를 포함한 대규모 데이터를 효과적인 특징 학습과 효율적인 검색으로 다루기 위해.
  • 전역 및 국소 특징 융합, 쿼리 확장, 데이터베이스 증강을 통해 검색 성능을 향상시키기 위해.
  • Google 랜드마크 데이터셋 V2에서 랜드마크 인식 및 검색 작업 양면에서 최상위 성능을 달성하기 위해.

제안 방법

  • 전역 특징 학습을 위한 분류 능력을 향상시키기 위해 ArcMargin 손실을 사용해 4개의 딥 컨volution 네트워크 백본(ResNet152, ResNet200, SE_ResNeXt152, InceptionV4)을 미세 조정한다.
  • 평균 풀링 이후 첫 번째 완전 연결 층에서 이미지 기술자를 추출한 후, 차원 감소를 위해 PCA를 적용하여 차원을 512로 감소시킨다.
  • 다양한 전역 기술자를 연결하여 융합하고, k-NN 검색을 통해 후보 검색을 수행한다.
  • 효율적인 근접 이웃 검색을 위해 역인덱스를 활용해 SURF, Hessian-Affine, SIFT를 사용한 국소 기술자 매칭을 통합한다.
  • 단계 2 인덱스 데이터에 대한 클러스터링을 통해 쿼리 확장 및 데이터베이스 증강을 적용하여 훈련 및 검색 커버리지를 확장한다.
  • 인식 신뢰도, 검색 점수, 빈도 기반 기법(빈도가 높은 랜드마크 집합 W)을 활용한 다단계 재정렬을 수행하여 간섭 요소를 억제한다.

실험 결과

연구 질문

  • RQ1딥 컨볼루션 네트워크와 ArcMargin 손실을 활용할 경우, 대규모 데이터셋에서 랜드마크 검색을 위한 전역 특징 표현이 어떻게 향상될 수 있는가?
  • RQ2SURF, SIFT, Hessian-Affine와 같은 국소 기술자 매칭은 기하학적 변환에 대해 얼마나 강건한 검색 성능 향상을 이끌 수 있는가?
  • RQ3클러스터링을 통한 쿼리 확장 및 데이터베이스 증강은 검색 커버리지 및 정확도 향상에 얼마나 효과적인가?
  • RQ4다중 모델 융합 및 반복적 재정렬은 랜드마크 벤치마크에서 인식 및 검색 성능 향상에 상당한 기여를 할 수 있는가?
  • RQ5빈도 기반 재정렬이 자주 발생하는 랜드마크에 대해 얼마나 영향을 미치며, 잘못된 양성 결과를 줄이고 GAP 스코어를 향상시키는가?

주요 결과

  • 시스템은 캐글 2019 경쟁에서 랜드마크 인식 및 검색 트랙 양쪽에서 2위를 기록했다.
  • 상위 랭킹 이미지에 빈도 기반 재정렬을 적용한 후, 사설 GAP 스코어는 0.37469, 공개 GAP 스코어는 0.36365에 도달했다.
  • 랜드마크 빈도에 기반해 A1B1, A1B2, A2B1, A2B2, A3B1, A3B2에 속한 이미지의 점수를 재정렬하는 빈도 기반 기법이 GAP 스코어를 0.35988에서 0.37469로 향상시켰다.
  • ArcMargin 손실과 PCA를 활용한 다수의 CNN 백본은 특징 차원을 감소시키면서도 분류 능력을 유지했다.
  • 전역 특징과 국소 특징(SURF, Hessian-Affine, SIFT)을 융합한 통합은 어려운 변형 샘플에서 성능 향상에 크게 기여했다.
  • 모든 등급 카테고리로 빈도 기반 재정렬를 확장함으로써, 최종 모델은 사설 GAP 스코어 0.38231과 공개 GAP 스코어 0.36805를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.