Skip to main content
QUICK REVIEW

[논문 리뷰] Seeing the Big Picture: Deep Embedding with Contextual Evidences

Liang Zheng, Shengjin Wang|arXiv (Cornell University)|2014. 06. 01.
Advanced Image and Video Retrieval Techniques참고 문헌 8인용 수 16
한 줄 요약

이 논문은 컨volution 신경망(CNN) 특징을 사용하여 局부, 지역, 전역적 맥락적 단서를 통합함으로써 Bag-of-Words(BoW) 영상 검색 성능을 향상시키는 확률적 프레임워크인 Deep Embedding을 제안한다. 매칭 신뢰도를 세 수준의 유사도 점수 곱으로 모델링함으로써, 거짓 양성(false positives)을 크게 감소시키고, 메모리 및 쿼리 시간의 약간의 증가만으로도 기준 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

In the Bag-of-Words (BoW) model based image retrieval task, the precision of visual matching plays a critical role in improving retrieval performance. Conventionally, local cues of a keypoint are employed. However, such strategy does not consider the contextual evidences of a keypoint, a problem which would lead to the prevalence of false matches. To address this problem, this paper defines "true match" as a pair of keypoints which are similar on three levels, i.e., local, regional, and global. Then, a principled probabilistic framework is established, which is capable of implicitly integrating discriminative cues from all these feature levels. Specifically, the Convolutional Neural Network (CNN) is employed to extract features from regional and global patches, leading to the so-called "Deep Embedding" framework. CNN has been shown to produce excellent performance on a dozen computer vision tasks such as image classification and detection, but few works have been done on BoW based image retrieval. In this paper, firstly we show that proper pre-processing techniques are necessary for effective usage of CNN feature. Then, in the attempt to fit it into our model, a novel indexing structure called "Deep Indexing" is introduced, which dramatically reduces memory usage. Extensive experiments on three benchmark datasets demonstrate that, the proposed Deep Embedding method greatly promotes the retrieval accuracy when CNN feature is integrated. We show that our method is efficient in terms of both memory and time cost, and compares favorably with the state-of-the-art methods.

연구 동기 및 목표

  • 로컬 특징을 초월한 맥락적 증거를 忽略함으로써 발생하는 Bag-of-Words(BoW) 영상 검색에서의 높은 거짓 매칭 비율을 해결하기 위해.
  • 로컬(SIFT), 지역(CNN를 이용한 이미지 패치), 전역(전체 이미지에 대한 CNN) 특징을 포함한 다수준 맥락적 단서를 원칙적인 확률 모델에 통합하기 위해.
  • 새로운 색인 구조인 Deep Indexing를 통해 CNN 특징을 BoW 프레임워크에 효과적으로 통합하기 위해.
  • 특히 큰 시각적 변형이 발생할 경우, 전통적인 색상 히스토GRAM보다 더 강력하고 구분력 있는 단서를 제공하는 CNN 특징의 강점을 입증하기 위해.
  • 대규모 환경에서 높은 메모리 및 시간 오버헤드 없이도 최신 기술 수준의 검색 정확도를 달성하기 위해.

제안 방법

  • 진짜 매칭을 정의하기 위해, 세 수준(로컬(SIFT), 지역(80개의 이미지 패치에 대한 CNN), 전역(전체 이미지에 대한 CNN))에서 모두 시각적으로 유사한 키포인트 쌍으로 간주한다.
  • 세 수준의 유사도 점수 곱으로 묵시적으로 매칭 신뢰도를 정의하는 확률 모델을 구축함으로써, 다수준 특징의 원칙적인 융합이 가능하도록 한다.
  • 미리 학습된 CNN을 사용하여 지역 및 전역 이미지 패치에서 고수준 의미적 표현을 제공하는 깊이 특징을 추출한다.
  • 이중 CNN 특징를 효율적으로 저장하고 검색하기 위한 Deep Indexing 구조를 도입함으로써, 기준 BoW 및 해밍 임bedding 방법보다 메모리 사용량을 줄였다.
  • 실시간 검색을 위해 TF-IDF 가중치 및 역색인 색인 기법을 적용하여 CNN 특징를 표준 BoW 파이프라인에 통합한다.
  • 그래프 융합 및 쿼리 확장과 같은 후처리 기법을 적용하여 기준 데이터셋에서 성능을 추가로 향상시켰다.

실험 결과

연구 질문

  • RQ1로컬 특징 외의 지역 및 전역 맥락적 단서를 로컬 특징과 융합함으로써 BoW 기반 영상 검색에서 거짓 매칭을 크게 감소시킬 수 있는가?
  • RQ2과도한 메모리 또는 계산 비용 없이, 깊이 있는 CNN 특징를 기존 BoW 검색 파이프라인에 효과적이고 효율적으로 통합할 수 있는가?
  • RQ3로컬, 지역, 전역 유사도를 융합하는 제안된 확률적 융합 프레임워크가 기존 방법보다 검색 정확도 측면에서 뛰어나게 성능을 발휘하는가?
  • RQ4큰 시각적 변형 상황에서, CNN 기반 맥락적 특징은 전통적인 색상 기반 맥락적 단서에 비해 어떤 영향을 미치는가?
  • RQ5Deep Embedding 프레임워크는 대규모 영상 검색 환경에서 최신 기술 수준 성능을 달성하면서도 높은 효율성(메모리 및 쿼리 시간)을 유지할 수 있는가?

주요 결과

  • 제안된 Deep Embedding 방법은 후처리 없이도 Holidays 데이터셋에서 mAP 88.1%와 Oxford5k에서 mAP 82.0%를 달성하여, BoW 기반 기준 모델 및 이전 최신 기술 수준 방법을 초월한다.
  • 그래프 융합 및 쿼리 확장과 같은 후처리를 적용한 결과, Ukbench에서 N-S 점수 3.87, Holidays에서 mAP 87.3%를 기록하여 최신 기술 수준의 경쟁력을 입증했다.
  • 128비트 해밍 임베딩 대비 단지 2.26GB의 메모리 증가만으로도, 다수준 맥락 필터링을 통한 거짓 매칭 감소 효과를 보였다.
  • Holidays+1M 데이터셋에서 쿼리 시간은 2.32초로, 해밍 임베딩(2.70초)에 비해 약간 높을 뿐이지, 추가 해밍 거리 계산에도 불구하고 높은 효율성을 유지하고 있다.
  • Holidays 데이터셋에 대한 시각적 결과는, Deep Embedding가 CNN 특징에서 유지된 의미적 단서 덕분에 로컬 SIFT 특징이 모호한 경우에도 의미적으로 관련 있는 영상을 성공적으로 검색함을 보여준다.
  • 광범위한 분석 결과, 색상 히스토GRAM에 비해 CNN 기반 지역 및 전역 특징이 특히 큰 외관 변화 상황에서 맥락적 증거를 더 효과적으로 포착함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.