Skip to main content
QUICK REVIEW

[논문 리뷰] A Practical Guide to CNNs and Fisher Vectors for Image Instance Retrieval

Vijay Chandrasekhar, Jie Lin|arXiv (Cornell University)|2015. 08. 11.
Advanced Image and Video Retrieval Techniques참고 문헌 41인용 수 12
한 줄 요약

이 논문은 이미지 인스턴스 검색을 위한 피셔 벡터(Fisher Vectors, FVs)와 컨volution 신경망(Convolutional Neural Network, CNN)-기반 기술 간의 종합적인 실험적 비교를 제공한다. 여러 데이터셋을 대상으로 두 방법을 평가하고, 아키텍처, 훈련 데이터, 기하학적 변환에 대한 불변성의 영향을 분석하며, FV와 CNN을 융합함으로써 검색 성능을 크게 향상시킬 수 있음을 보여주며, 특히 CNN의 회전 및 체적 민감성 문제를 데이터베이스 측면의 풀링 전략을 통해 해결함으로써 성능 향상을 이룬다.

ABSTRACT

With deep learning becoming the dominant approach in computer vision, the use of representations extracted from Convolutional Neural Nets (CNNs) is quickly gaining ground on Fisher Vectors (FVs) as favoured state-of-the-art global image descriptors for image instance retrieval. While the good performance of CNNs for image classification are unambiguously recognised, which of the two has the upper hand in the image retrieval context is not entirely clear yet. In this work, we propose a comprehensive study that systematically evaluates FVs and CNNs for image retrieval. The first part compares the performances of FVs and CNNs on multiple publicly available data sets. We investigate a number of details specific to each method. For FVs, we compare sparse descriptors based on interest point detectors with dense single-scale and multi-scale variants. For CNNs, we focus on understanding the impact of depth, architecture and training data on retrieval results. Our study shows that no descriptor is systematically better than the other and that performance gains can usually be obtained by using both types together. The second part of the study focuses on the impact of geometrical transformations such as rotations and scale changes. FVs based on interest point detectors are intrinsically resilient to such transformations while CNNs do not have a built-in mechanism to ensure such invariance. We show that performance of CNNs can quickly degrade in presence of rotations while they are far less affected by changes in scale. We then propose a number of ways to incorporate the required invariances in the CNN pipeline. Overall, our work is intended as a reference guide offering practically useful and simply implementable guidelines to anyone looking for state-of-the-art global descriptors best suited to their specific image instance retrieval problem.

연구 동기 및 목표

  • 표준 이미지 인스턴스 검색 벤치마크에서 피셔 벡터와 CNN 기반 기술의 성능을 체계적으로 평가하는 것.
  • 네트워크 깊이, 아키텍처, 훈련 데이터, 기술 유형이 검색 정확도에 미치는 영향을 조사하는 것.
  • 회전 및 체적 변화와 같은 기하학적 변환에 대해 CNN과 FV 특징의 내성에 대해 분석하는 것.
  • 특히 데이터베이스 측면의 풀링 전략을 포함한 실용적이고 구현 가능한 전략을 제안하여 CNN 특징의 회전 및 체적 불변성을 향상시키는 것.
  • FV와 CNN 기술을 융합할 경우 검색 성능 향상이 이루어지는지 확인하는 것.

제안 방법

  • 논문은 다양한 FV 변형을 평가한다: 희박(DoG 기반) 및 조밀한 관심점, 단일 척도 및 다중 척도 설정.
  • CNN에 대해서는 다양한 레이어(예: fc6, pool5), 네트워크 깊이, 훈련 데이터의 영향을 검색 성능에 대해 분석한다.
  • 논문은 데이터베이스 이미지의 회전 및 체적 변형된 복수의 버전에 대해 최대 풀링을 수행하는 데이터베이스 측면의 풀링 전략을 도입하여 CNN 특징의 불변성을 향상시킨다.
  • 성능 평가는 Holidays, Oxford5k 및 추가 데이터셋과 같은 표준 벤치마크를 사용하며, 주요 평가 지표로 mAP를 사용한다.
  • 단일 모델 성능과 FV 및 CNN 기술의 하이브리드 융합 성능를 비교하여 상호 보완적 성능 향상을 평가한다.
  • 기하학적 불변성은 쿼리 이미지의 회전 및 체적 변화를 체계적으로 변화시켜 성능 저하 정도를 측정함으로써 테스트한다.

실험 결과

연구 질문

  • RQ1표준 벤치마크에서 최신 기술인 CNN과 피셔 벡터 기술 간의 검색 성능는 어떻게 비교되는가?
  • RQ2CNN과 FV 기술을 융합할 경우 검색 성능 향상이 이루어지는가?
  • RQ3CNN 특징는 FV 특징에 비해 회전 및 체적 변화에 대해 얼마나 불변성이 있는가?
  • RQ4데이터베이스 측면의 풀링 전략은 실제로 CNN 특징의 회전 및 체적 불변성을 복원하는 데 효과적인가?
  • RQ5더 깊은 CNN 레이어는 더 얕은 레이어에 비해 기하학적 변환에 더 견고한가?

주요 결과

  • CNN의 첫 번째 완전 연결 레이어(fc6)는 테스트된 모든 모델에서 강력한 종합적인 성능을 제공한다.
  • 더 깊은 네트워크는 훈련 및 테스트 데이터가 유사할 경우에만 성능 향상을 이룬다; 그렇지 않으면 과적합으로 인해 성능 저하가 발생할 수 있다.
  • 훈련 데이터는 CNN 성능에 상당한 영향을 미치며, 더 깊은 레이어일수록 도메인 특이성이 더 크다.
  • 다중 척도 관심점은 단일 척도 FV를 항상 승리하며, 고도로 무늬가 있는 비불변성 데이터셋에서는 DoG 기반 관심점보다 조밀한 샘플링이 더 우수한 성능을 보인다.
  • 데이터베이스 이미지의 회전 및 체적 변형된 복수의 버전에 대해 최대 풀링을 수행하는 것은 CNN의 회전 및 체적에 대한 저항성을 크게 향상시키며, 전체 체적 저장이 가능한 최소 거리 풀링 성능에 근접하게 만든다.
  • DoG 기반 관심점에 기반한 피셔 벡터는 조밀한 FV보다 더 높은 회전 불변성을 보이며, CNN 특징는 어떤 FV 변형보다도 체적 변화에 더 견고하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.