Skip to main content
QUICK REVIEW

[논문 리뷰] Detect-to-Retrieve: Efficient Regional Aggregation for Image Search

Marvin Teichmann, André Araujo|arXiv (Cornell University)|2018. 12. 04.
Advanced Image and Video Retrieval Techniques참고 문헌 40인용 수 4
한 줄 요약

이 논문은 효율적이고 정확한 이미지 검색을 위해 훈련된 랜드마크 검출기를 사용하여 관련 이미지 영역을 선택하는 Detect-to-Retrieve 방법을 제안한다. 새로운 지역 집합 선택 매칭 커널(R-ASMK)을 적용함으로써 차원 수를 늘리지 않으면서도 검색 정확도를 향상시켜, Revisited Oxford-Hard에서 이전 방법보다 9.3% 향상되고, Revisited Paris-Hard에서 1.9% 향상된다. 이는 86,000개의 수동으로 주석 처리된 랜드마크 바운딩 박스로 구성된 새로운 데이터셋을 사용한 결과이다.

ABSTRACT

Retrieving object instances among cluttered scenes efficiently requires compact yet comprehensive regional image representations. Intuitively, object semantics can help build the index that focuses on the most relevant regions. However, due to the lack of bounding-box datasets for objects of interest among retrieval benchmarks, most recent work on regional representations has focused on either uniform or class-agnostic region selection. In this paper, we first fill the void by providing a new dataset of landmark bounding boxes, based on the Google Landmarks dataset, that includes $86k$ images with manually curated boxes from $15k$ unique landmarks. Then, we demonstrate how a trained landmark detector, using our new dataset, can be leveraged to index image regions and improve retrieval accuracy while being much more efficient than existing regional methods. In addition, we introduce a novel regional aggregated selective match kernel (R-ASMK) to effectively combine information from detected regions into an improved holistic image representation. R-ASMK boosts image retrieval accuracy substantially with no dimensionality increase, while even outperforming systems that index image regions independently. Our complete image retrieval system improves upon the previous state-of-the-art by significant margins on the Revisited Oxford and Paris datasets. Code and data available at the project webpage: https://github.com/tensorflow/models/tree/master/research/delf.

연구 동기 및 목표

  • 이미지 내 소형 또는 혼잡한 물체를 검색하는 데 어려움을 해결하기 위해 검색을 위한 영역 선택을 향상시키는 것.
  • 기존의 균일하거나 클래스 무관 영역 선택 방식을 사용하는 지역 검색 방법의 비효율성과 높은 메모리 비용을 줄이는 것.
  • 객체의 의미 정보를 활용하여 관련 영역에 집중 인덱싱을 수행함으로써 계산 오버헤드를 최소화하면서 정확도를 향상시키는 방법을 개발하는 것.
  • 훈련을 위한 강력한 객체 검출기를 지원하기 위해 86,000개의 수동으로 주석 처리된 랜드마크 바운딩 박스로 구성된 새로운 데이터셋을 제공하는 것.
  • 검색 기술에서 디스크립터 차원 수를 늘리지 않으면서도 검출된 영역을 활용해 통합된 이미지 표현을 향상시키는 지역 집합 메커니즘을 설계하는 것.

제안 방법

  • 15,000개의 고유 랜드마크를 위한 86,000장의 이미지와 수동으로 코딩된 바운딩 박스를 포함하는 새로운 데이터셋을 도입하여 정확한 랜드마크 검출기 훈련을 가능하게 한다.
  • 고정되거나 클래스에 무관한 영역 선택 방식을 대체하기 위해 훈련된 객체 검출기(Faster R-CNN 및 SSD)를 사용하여 이미지 내 주목할 만한 영역을 식별한다.
  • 지역 집합 선택 매칭 커널(R-ASMK)은 각 영역의 VLAD 디스크립터를 합성 풀링과 시각어 단위 정규화를 통해 결합하여 통합적이고 구분력 있는 이미지 표현을 생성한다.
  • R-ASMK는 검출된 영역 내에서 특징의 공간적 위치에 따라 국소적 특징을 재가중하여 주목할 만한 영역의 특징 관련성을 향상시킨다.
  • 딥 로컬 특징(DELF)을 사용하고 R-ASMK를 적용하여 디스크립터 크기를 늘리지 않으면서도 검색 중 유사도 추정을 향상시킨다.
  • 영역 기반 표현 학습과 선택적 매칭 커널을 통합하여 이미지 검색 파이프라인에서 효율적인 필터링과 재순서 정렬을 가능하게 한다.

실험 결과

연구 질문

  • RQ1고정되거나 클래스에 무관한 방법에 비해, 훈련된 객체 검출기가 혼잡한 환경에서 이미지 검색을 위한 영역 선택을 향상시킬 수 있는가?
  • RQ2지역 인식 표현은 디스크립터 차원 수를 늘리지 않으면서도 검색 정확도를 향상시킬 수 있는가?
  • RQ3전용 검출 모델을 통해 객체 의미 정보를 활용하면 Revisited Oxford 및 Paris와 같은 표준 벤치마크에서 더 높은 성능을 달성할 수 있는가?
  • RQ4제안된 R-ASMK 커널은 디스크립터 차원 수를 늘리지 않으면서도 독립적 영역 인덱싱 및 전역 표현 방법에 비해 정확도와 효율성 측면에서 어떻게 비교되는가?
  • RQ5수동으로 주석 처리된 랜드마크 바운딩 박스 데이터셋은 검출기 일반화 능력과 검색 성능 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 방법은 Revisited Oxford-Hard 데이터셋에서 평균 평균 정밀도를 9.3%p 절대적으로 향상시켜 이전 최고 기술을 크게 능가한다.
  • Revisited Paris-Hard 데이터셋에서는 이전 방법에 비해 평균 평균 정밀도가 1.9%p 절대적으로 향상된다.
  • R-ASMK 커널은 디스크립터 차원 수를 늘리지 않더라도 독립적 영역 인덱싱 시스템을 능가하는 성능을 보인다.
  • 훈련된 랜드마크 검출기는 600,000번의 훈련 스텝 후 약 85%의 mAP를 달성하며, Faster R-CNN에 비해 더 빠른 수렴 속도와 略로 높은 성능을 보이는 SSD 기반 모델이 약간 더 우수한 성능을 보인다.
  • 시각화 결과는 검출기가 두드러진 랜드마크에 집중하는 반면, RMAC 및 Selective Search는 덜 관련 있거나 잘못 정렬된 영역을 생성하는 것으로 나타났다.
  • 이 방법은 데이터베이스 크기의 약간의 증가만으로도 기존 지역 검색 기술에 비해 상당한 정확도 향상을 달성하면서도 효율성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.