Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient large-scale image retrieval with deep feature orthogonality and Hybrid-Swin-Transformers

Christof Henkel|arXiv (Cornell University)|2021. 10. 07.
Advanced Image and Video Retrieval Techniques인용 수 5
한 줄 요약

이 논문은 대규모 이미지 검색 및 랜드마크 인식을 위한 엔드 투 엔드 딥러닝 파이프라인을 제시하며, 국소적 및 전역적 특징의 심층 수직 융합(DOLG)과 새로운 하이브리드-Swin-Transformer 아키텍처를 결합한다. 이 방법은 동적 마진을 가진 서브센터 아크페이스와 소프트 분류적 재정렬 전략을 사용하여, 2021년 구글 랜드마크 경쟁에서 두 트랙 모두에서 최고 성능을 기록했다.

ABSTRACT

We present an efficient end-to-end pipeline for largescale landmark recognition and retrieval. We show how to combine and enhance concepts from recent research in image retrieval and introduce two architectures especially suited for large-scale landmark identification. A model with deep orthogonal fusion of local and global features (DOLG) using an EfficientNet backbone as well as a novel Hybrid-Swin-Transformer is discussed and details how to train both architectures efficiently using a step-wise approach and a sub-center arcface loss with dynamic margins are provided. Furthermore, we elaborate a novel discriminative re-ranking methodology for image retrieval. The superiority of our approach was demonstrated by winning the recognition and retrieval track of the Google Landmark Competition 2021.

연구 동기 및 목표

  • 대규모 랜드마크 인식 및 검색에서 긴 꼬리 분포, 내부 클래스 변동성, 노이즈 있는 레이블 등의 과제를 해결하기 위해.
  • 단일 단계 모델에서 국소적 및 전역적 특징을 심층 수직 융합을 통해 융합함으로써 특징 표현을 향상시키기 위해.
  • 클래스 불균형을 더 잘 다루기 위해 동적 마진을 가진 서브센터 아크페이스를 사용하여 모델의 일반화 및 강인성을 향상시키기 위해.
  • 쿼리 및 인덱스 이미지 간의 레이블 일관성을 활용하여 검색 정확도를 향상시키는 새로운 소프트 분류적 재정렬 방법을 개발하기 위해.
  • 코드 기반 경쟁 환경에서 엄격한 추론 시간 및 자원 제약 조건 하에서도 최첨단 성능을 달성하기 위해.

제안 방법

  • 확장된 컨볼루션에서 유도된 1024D 국소적 특징과 공간 자기주의 후 수직 융합을 통해 전역적 특징을 융합하는 DOLG-EfficientNet-B5 아키텍처를 제안한다.
  • CNN과 트랜스포머의 강점을 융합하기 위해 EfficientNet 백본과 Swin Transformer 블록을 조합한 새로운 하이브리드-Swin-Transformer 모델을 도입한다.
  • 긴 꼬리 분포 및 노이즈 있는 데이터 분포에서의 분류 성능 향상을 위해 동적 마진을 가진 서브센터 아크페이스를 적용한다.
  • 8개의 V100 GPU에서 혼합 정밀도 학습과 단계적 학습 전략을 사용하며, albumentations를 통한 데이터 증강(이동, 스케일, 회전, 컷아웃)을 적용한다.
  • 소프트 분류적 재정렬 절차를 적용: 매칭 레이블을 위해 훈련 세트의 상위 3개 코사인 유사도를 추가(업랭킹), 비매칭 레이블을 위해 0.1× 상위 3개 유사도를 감산(다운랭킹).
  • 8개 모델(DOLG, 하이브리드-Swin, 순수 EfficientNet)의 예측을 평균 내어 각 모델 유형별로 기술자소를 융합하고, 이를 연결하여 최종 추론를 위한 1536D 벡터를 구성한다.

실험 결과

연구 질문

  • RQ1긴 꼬리 분포 및 내부 클래스 변동성 하에서 국소적 및 전역적 특징의 심층 수직 융합이 대규모 랜드마크 검색 성능을 향상시킬 수 있는가?
  • RQ2제안된 하이브리드-Swin-Transformer 아키텍처는 CNN과 트랜스포머의 장점을 융합하여 랜드마크 인식에 얼마나 효과적인가?
  • RQ3GLDv2와 같은 긴 꼬리 분포 및 노이즈 있는 데이터 세트에서 표준 아크페이스보다 서브센터 아크페이스에 동적 마진을 적용한 것이 우수한 성능을 내는가?
  • RQ4하드 임계값에 의존하지 않고도 소프트 분류적 재정렬 전략이 검색 작업의 mAP를 크게 향상시킬 수 있는가?
  • RQ5단일 단계 엔드 투 엔드 모델이 대규모 인스턴스 수준의 인식에서 이중 단계 파이프라인을 초월할 수 있는 정도는 어느 정도인가?

주요 결과

  • DOLG-EfficientNet-B5 모델은 검색 트랙에서 개인 mAP 0.478, 공개 mAP 0.464를 기록하여 앙상블 내 다른 모델들을 압도했다.
  • 하이브리드-Swin-Transformer 모델(EfficientNet-B6-Swin-Base-384)은 개인 mAP 0.487, 공개 mAP 0.462를 기록하여 하이브리드 CNN-Transformer 설계의 효과성을 입증했다.
  • 최종 앙상블 모델은 검색 트랙에서 개인 mAP 0.537, 공개 mAP 0.518를 기록하여 대회에서 1위를 차지했다.
  • 인식 앙상블는 개인 GAP 0.513, 공개 GAP 0.534를 기록하여 인식 트랙에서 1위를 차지했다.
  • 소프트 분류적 재정렬 절차는 레이블 일관성을 향상시키고 가짜 양성 결과를 감소시켜 검색 성능을 크게 향상시켰다.
  • 서브센터 아크페이스에 동적 마진을 적용하고 심층 수직 융합을 결합함으로써 노이즈가 많고 긴 꼬리 분포를 가진 데이터에서 일반화 성능이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.