Skip to main content
QUICK REVIEW

[논문 리뷰] Google Landmark Recognition 2020 Competition Third Place Solution

Qishen Ha, Bo Liu|arXiv (Cornell University)|2020. 10. 11.
Multimodal Machine Learning Applications참고 문헌 3인용 수 9
한 줄 요약

이 논문은 글로벌 특징 전용 Sub-center ArcFace 모델의 앙상블을 사용하여 Google Landmark Recognition 2020 경쟁에서 3등을 차지한 솔루션을 제시한다. GLDv2 데이터셋의 불균형 문제를 고려해 ArcFace 손실에 동적 마진을 도입하였으며, 이는 클래스 크기의 연속 함수로 정의되며 성능을 향상시킨다. 더불어 점진적 미세조정과 다단계 후처리를 결합하여 사전 리더보드 점수 0.6344를 달성하였다.

ABSTRACT

We present our third place solution to the Google Landmark Recognition 2020 competition. It is an ensemble of global features only Sub-center ArcFace models. We introduce dynamic margins for ArcFace loss, a family of tune-able margin functions of class size, designed to deal with the extreme imbalance in GLDv2 dataset. Progressive finetuning and careful postprocessing are also key to the solution. Our two submissions scored 0.6344 and 0.6289 on private leaderboard, both ranking third place out of 736 teams.

연구 동기 및 목표

  • GLDv2 데이터셋의 극심한 클래스 불균형 문제를 해결하여 모델 수렴 및 일반화 능력을 향상시키기 위해.
  • ArcFace의 상수 마진을 클래스 크기에 따라 적응적으로 변화하는 마진으로 대체하여 글로벌 특징 전용 모델의 성능을 햖थ기 위해.
  • 다양한 이미지 해상도에서 점진적 미세조정 스케줄을 통해 대규모, 긴 꼬리형 데이터셋에서의 학습 효율성과 모델 일반화 능력을 최적화하기 위해.
  • 특징 유사도 검색과 ArcFace 헤드 점수를 거듭제곱 기반 후처리로 조합하여 추론 정확도를 향상시키기 위해.
  • 최근 백본 모델의 발전을 고려할 때, 이 작업에서 국소 특징은 글로벌 특징보다 성능 향상에 기여하지 않음을 입증하기 위해.

제안 방법

  • 클래스 크기의 연속 함수로 정의된 ArcFace 손실을 위한 동적 마진을 제안: $ f(n) = a \cdot n^{-\lambda} + b $, 여기서 $ n $은 클래스 크기이며, $ a, b, \lambda $는 조정 가능한 파라미터이다.
  • 장소 이미지의 내부 클래스 변동성을 더 잘 포착하기 위해 각 클래스당 $ K=3 $개의 서브센터를 사용하는 Sub-center ArcFace를 사용한다.
  • 세 단계로 구성된 점진적 미세조정 전략을 구현: 256px에서 410만 장의 이미지로 사전학습, 512–768px에서 320만 장의 이미지로 미세조정, 이후 672–1024px에서 추가로 미세조정.
  • 수평 반전, 압축, 이동, 스케일, 회전, 컷아웃 등의 데이터 증강 기법을 적용하지만, 성능 저하를 유발할 수 있는 과도한 증강은 피한다.
  • 후처리 단계에서 코사인 유사도에 8차 거듭제곱 함수를 적용하여 상위-k 최근접 이웃 예측을 융합한 후, ArcFace 헤드 점수에 12차 거듭제곱 융합을 통해 추가로 정밀도를 향상시킨다.
  • 다양한 두 종류의 앙상블을 구성: 표준 미세조정을 사용한 7개 모델로 구성된 앙상블 1, 추가적인 미세조정 에포크와 모델 변종을 포함하여 다양성과 성능을 향상시킨 9개 모델로 구성된 앙상블 2.

실험 결과

연구 질문

  • RQ1최근 백본 모델의 발전을 고려할 때, 글로벌 특징 전용 모델이 하이브리드 글로벌-로컬 모델보다 장소 인식 성능에서 뛰어나게 될 수 있는가?
  • RQ2ArcFace 손실은 GLDv2와 같은 긴 꼬리형 데이터셋의 극심한 클래스 불균형 문제를 어떻게 다룰 수 있는가?
  • RQ3작은 클래스와 큰 클래스 양쪽에서 일반화 능력을 향상시키는 데 최적의 동적 마진 함수는 무엇인가?
  • RQ4다양한 이미지 해상도에서 점진적 미세조정이 대규모 장소 인식에서 모델 성능에 어떤 영향을 미치는가?
  • RQ5특징 유사도와 ArcFace 로짓을 융합하는 후처리 방법이 최종 추론 정확도를 얼마나 향상시킬 수 있는가?

주요 결과

  • 최적의 동적 마진 함수인 $ n^{-1/4} $ (하한 0.05, 상한 0.5)는 ResNet-B0 모델에서 상수 마진 기반 베이스라인 대비 검증 GAP에서 0.025 향상된 성능을 기록하였다.
  • 앙상블 1은 사전 리더보드 점수 0.6289, 공개 리더보드 점수 0.6604를 기록하여 3등을 차지하였다.
  • 앙상블 2는 더 높은 사전 리더보드 점수 0.6344와 공개 리더보드 점수 0.6581를 기록하여 역시 3등을 차지하였다.
  • 상위-5 최근접 이웃 유사도에 8차 거듭제곱 융합을 적용한 후처리로, 최고의 단일 모델의 사전 리더보드 점수는 0.5859에서 0.6040으로 향상되었다.
  • ArcFace 헤드 점수에 12차 거듭제곱 융합을 통합함으로써, 최고의 단일 모델 점수는 사전 리더보드에서 0.6244로 상승하였다.
  • DELG와 같은 국소 특징 모델은 앙상블 성능 향상에 기여하지 않았으며, 고도로 발전한 아키텍처와 손실 적응 기법을 통해 글로벌 특징의 효과성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.