Skip to main content
QUICK REVIEW

[논문 리뷰] Unifying Deep Local and Global Features for Image Search

Bingyi Cao, André Araujo|arXiv (Cornell University)|2020. 01. 14.
Advanced Image and Video Retrieval Techniques참고 문헌 64인용 수 34
한 줄 요약

DELG는 깊은 로컬 및 글로벌 이미지 특징을 하나의 엔드투엔드 학습 가능 모델로 통합하여, 글로벌 특징에 대한 GeM 풀링과 자동 인코더 기반 차원 축소를 활용한 주의 기반 로컬 특징 선택을 결합함으로써 최첨단 이미지 검색 및 인스턴스 수준 인식을 달성합니다.

ABSTRACT

Image retrieval is the problem of searching an image database for items that are similar to a query image. To address this task, two main types of image representations have been studied: global and local image features. In this work, our key contribution is to unify global and local features into a single deep model, enabling accurate retrieval with efficient feature extraction. We refer to the new model as DELG, standing for DEep Local and Global features. We leverage lessons from recent feature learning work and propose a model that combines generalized mean pooling for global features and attentive selection for local features. The entire network can be learned end-to-end by carefully balancing the gradient flow between two heads -- requiring only image-level labels. We also introduce an autoencoder-based dimensionality reduction technique for local features, which is integrated into the model, improving training efficiency and matching performance. Comprehensive experiments show that our model achieves state-of-the-art image retrieval on the Revisited Oxford and Paris datasets, and state-of-the-art single-model instance-level recognition on the Google Landmarks dataset v2. Code and models are available at https://github.com/tensorflow/models/tree/master/research/delf .

연구 동기 및 목표

  • 검색 효율성과 정확성을 위해 글로벌 및 로컬 이미지 표현의 통합을 촉진한다.
  • 글로벌 디스크립터, 키포인트 주의(attention), 로컬 디스크립터를 공동으로 학습하는 unified CNN 기반 모델을 개발한다.
  • 글로벌 헤드와 로컬 헤드 간의 그래디언트 흐름을 신중히 제어하여 패치 수준 감독의 필요성을 없앤다.
  • 후처리 PCA 없이 로컬 특징 차원을 축소하기 위한 합성곱 자동인코더를 도입한다.
  • Revisited Oxford/Paris 및 Google Landmarks v2 데이터셋에서 최첨단 성능을 입증한다.

제안 방법

  • CNN 백본을 사용하여 얕은 피처 맵(S)와 깊은 피처 맵(D)을 생성하고, 이로부터 글로벌 및 로컬 피처를 도출한다.
  • 글로벌 피처는 D에 대해 일반화 평균 풀링(GeM)을 통해 형성되고, 학습 가능한 화이트닝 레이어를 거쳐 2048-차원 글로벌 디스크립터를 생성한다.
  • 로컬 피처는 S에서 얻어지며 1x1 합성곱 자동인코더를 통과해 컴팩트 디스크립터를 얻고, 주의 맵 M이 판별력이 높은 영역을 선택한다.
  • 글로벌 피처에 대해 ArcFace 기반 코사인 분류기, 로컬 피처에 대한 자동인코더 재구성 손실, 주의 기반 소프트맥스 손실의 세 가지 손실로 엔드-투-엔드로 학습한다.
  • 공동 학습 중 의미 있는 로컬 표현을 유지하기 위해 로컬-주의 및 재구성 손실의 그래디언트가 CNN 백본으로 역전파되는 것을 차단한다.
  • 모델은 오직 이미지 수준 감독으로 학습되며, 글로벌 및 로컬 헤드 간의 그래디언트 흐름의 균형을 맞춰 계층적 피처 표현의 저하를 피한다.
  • 선택적 이진화 변형(DELG ⋆)은 대규모 검색을 위해 로컬 피처를 이진 형태로 저장하며, 성능과의 트레이드오프가 논의된다.

실험 결과

연구 질문

  • RQ1단일 엔드투엔드 모델이 이미지 검색을 위해 글로벌 디스크립터와 로컬의 주의 가중치가 부여된 특징을 모두 효과적으로 학습할 수 있는가?
  • RQ2로컬 디스크립터에 대한 자동인코더를 통합하고 그래디언트 제어를 사용하면 패치 수준 감독 없이 공동 최적화를 가능하게 하는가?
  • RQ3GeM 풀링과 ArcFace 손실이 통합된 DELG 모델에서 강력한 글로벌 특징으로 어떻게 상호 작용하는가?
  • RQ4표준 벤치마크(Oxford/Paris revisited, GLDv2)에서 엔드투엔드 학습이 검색 및 인식 성능에 미치는 영향은 특화된 다중 모델 파이프라인과 비교해 어떤가?

주요 결과

  • DELG는 단일 통합 모델로 Revisited Oxford, Revisited Paris, 및 Google Landmarks v2에서 최첨단 결과를 달성한다.
  • GeM 풀링과 ArcFace 손실이 글로벌 특징 성능을 향상시키고, 경량 자동인코더를 가진 주의 주도 로컬 특징 경로가 강력한 로컬 디스크립터를 산출한다.
  • 적절한 그래디언트 차단을 통한 공동 학습은 계층적 피처 표현을 보존하고, 별도로 학습된 기준 방법들에 비해 경쟁력 있거나 우수한 성능을 달성한다.
  • 통합 모델은 글로벌 전용 및 글로벌+로컬 재랭킹 설정 모두에서 이전 방법들보다 우수하며, 1M 디스트랙터가 있는 대규모 시나리오를 포함한다.
  • 이진화된 변형(DELG ⋆)은 매우 큰 데이터베이스에서 경쟁력 있는 검색 정확도를 제공하는 메모리 효율적인 옵션이다.
  • DELG를 이용한 로컬 특징 재랭킹은 특히 대규모 데이터셋에서 성능을 크게 향상시킨다.
  • GLDv2에서 DELG 변형은 선도적인 mAP 및 μAP 성능을 달성하며, 글로벌 전용과 결합 구성 모두 검색 및 인식 작업에서 강한 결과를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.