Skip to main content
QUICK REVIEW

[논문 리뷰] Supporting large-scale image recognition with out-of-domain samples

Christof Henkel, Philipp Singer|arXiv (Cornell University)|2020. 10. 04.
Advanced Image and Video Retrieval Techniques참고 문헌 10인용 수 5
한 줄 요약

이 논문은 아크 마진 손실과 도메인 외 이미지 재정렬을 사용하여 글로벌 CNN 임베딩을 활용한 엔드 투 엔드 방법을 제시한다. 이는 랜드마크 인식 성능을 향상시키기 위한 것이다. 알려진 도메인 외 이미지(비랜드마크 이미지)를 기반으로 유사도 점수를 페널티 처리함으로써, 상태의 기술을 달성하였으며, 2020년 구글 랜드마크 인식 챌린지에서 공개 GAP 점수 0.6824로 1등을 차지하였다.

ABSTRACT

This article presents an efficient end-to-end method to perform instance-level recognition employed to the task of labeling and ranking landmark images. In a first step, we embed images in a high dimensional feature space using convolutional neural networks trained with an additive angular margin loss and classify images using visual similarity. We then efficiently re-rank predictions and filter noise utilizing similarity to out-of-domain images. Using this approach we achieved the 1st place in the 2020 edition of the Google Landmark Recognition challenge.

연구 동기 및 목표

  • 극도로 불균형한 클래스 분포와 높은 도메인 외 이미지 비중을 고려한 대규모 인스턴스 수준의 이미지 인식 과제를 해결한다.
  • Google Landmark Dataset v2 CLEAN에서 랜드마크와 비랜드마크를 효과적으로 구분하여 순위 매기기 성능을 향상시킨다.
  • 기존의 도메인 외(비랜드마크) 이미지와의 유사도를 기반으로 예측을 페널티 처리하는 강력한 재정렬 전략을 개발한다.
  • 다양한 CNN 백본과 통합된 재정렬 파이프라인을 사용하여 2020년 구글 랜드마크 인식 경연에서 최고 성능을 달성한다.

제안 방법

  • SE-ResNeXt101, EfficientNet B3, ResNet152, Res2Net101 등의 여러 CNN 백본을 아크 마진 손실로 훈련하여 512차원 특징 공간에 이미지를 임bedding한다.
  • 일반화 평균(GeM) 풀링을 적용한 후 간단한 넥(Linear + BatchNorm + PReLU)를 통해 정규화된 이미지 임베딩을 생성한다.
  • 시험 이미지와 후보 이미지 간의 유사도(A)를, 후보 이미지들이 알려진 비랜드마크 이미지들과 평균적으로 얼마나 유사한지에 따라 페널티를 적용하는 재정렬 절차를 적용한다(B).
  • 시험, 훈련, 비랜드마크 데이터셋의 임베딩 분포를 분위수 변환기(quantile transformers)를 사용하여 정규화하여 유사도 점수의 안정성을 높인다.
  • L2 정규화된 임베딩을 연결하여 앙상블 모델을 구성하고, 통합된 표현에 동일한 재정렬 파이프라인을 적용한다.
  • 각 이미지당 상위 3개의 유사한 후보를 사용하여 동일한 랜드마크에 대한 점수를 합산하고, 상위 10개의 비랜드마크 이미지와의 유사도를 기반으로 최종 신뢰도 페널티를 적용한다(C).

실험 결과

연구 질문

  • RQ1어떻게 도메인 외(비랜드마크) 이미지를 효과적으로 활용하여 대규모 인스턴스 수준의 인식에서 순위를 향상시킬 수 있는가?
  • RQ2기존의 비랜드마크 이미지와의 유사도를 기반으로 한 재정렬이 불균형한 데이터셋에서 글로벌 평균 정확도(GAP)에 얼마나 기여하는가?
  • RQ3전역 이미지 임베딩만으로도 국소 기술자 표본에 의존하는 방법보다 대규모 랜드마크 인식 작업에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ4다양한 백본과 훈련 설정을 사용한 모델 앙상블은 랜드마크 인식에서 안정성과 일반화 능력을 어떻게 향상시키는가?

주요 결과

  • 제안된 재정렬 방법은 테스트 이미지가 랜드마크일지라도 알려진 비랜드마크 이미지와 유사한 예측에 대해 페널티를 적용함으로써 GAP 점수를 크게 향상시켰다.
  • 다양한 백본과 훈련 하이퍼파ram터를 사용한 7개 모델의 앙상블은 공개 리더보드 점수 0.6824와 사적 점수 0.6598을 기록하였다.
  • DELG나 SuperPoint와 같은 국소 기술자 기반 모델은 성능 향상이 미미했고, 높은 계산 비용에도 불구하고 기여가 거의 없어 기각되었다.
  • GLDv1에서의 미리 훈련은 성능 향상에 기여하지 않았으며, 최종 솔루션에서 불필요한 것으로 밝혀졌다.
  • 시험, 훈련, 비랜드마크 임베딩 분포 간의 분위수 정규화를 적용함으로써 점수 안정성과 유사도 일관성이 향상되었다.
  • 최종 솔루션은 물체 검출이나 카테고리 빈도 페널티 없이도 유사도 기반 재정렬과 도메인 외 감독을 통해 최첨단 성능을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.