Skip to main content
QUICK REVIEW

[논문 리뷰] DeepSeek: Content Based Image Search & Retrieval.

Tanya Piplani, David Bamman|arXiv (Cornell University)|2018. 01. 09.
Multimodal Machine Learning Applications참고 문헌 7인용 수 3
한 줄 요약

이 논문은 자연어 쿼리를 사용하여 의미적으로 관련된 이미지를 검색하는 컨텐츠 기반 이미지 검색 시스템인 DeepSeek를 제안한다. 이 시스템은 두 가지 방법을 활용한다: 미세조정된 ResNet-101과 스킵-사고트 벡터를 사용한 캡션 기반 검색, 그리고 학습된 이미지-텍스트 임베딩을 통한 엔드 투 엔드 임베딩 공간 검색; 후자는 상위 5개 검색에서 높은 정밀도(91.2%)를 기록했지만 상위 1개 검색 정밀도는 낮아(68.3%), 의미 기반 이미지 검색을 위한 공동 임베딩 학습의 효과를 입증한다.

ABSTRACT

Most of the internet today is composed of digital media that includes videos and images. With pixels becoming the currency in which most transactions happen on the internet, it is becoming increasingly important to have a way of browsing through this ocean of information with relative ease. YouTube has 400 hours of video uploaded every minute and many million images are browsed on Instagram, Facebook, etc. Inspired by recent advances in the field of deep learning and success that it has gained on various problems like image captioning and, machine translation , word2vec , skip thoughts, etc, we present DeepSeek a natural language processing based deep learning model that allows users to enter a description of the kind of images that they want to search, and in response the system retrieves all the images that semantically and contextually relate to the query. Two approaches are described in the following sections.

연구 동기 및 목표

  • 기존의 이미지 기반 쿼리, 제한된 키워드 매칭, 메타데이터에 의존하는 이미지 검색 시스템의 한계를 해결한다. 이러한 시스템은 종종 의미적 의미를 포착하지 못한다.
  • 자연어 기반 기술서를 입력 쿼리로 사용하여 정확하고 효율적인 콘텐츠 기반 이미지 검색을 가능하게 한다.
  • 이미지 기반 검색의 근본적인 결함을 극복하기 위해, 유사한 이미지를 요구하지 않고 기술적 텍스트로 검색할 수 있도록 한다.
  • 이미지 및 텍스트 특징이 의미적으로 정렬된 통합된 임베딩 공간을 개발하여 검색 성능을 향상시킨다.

제안 방법

  • MS-COCO 객체 검출 데이터셋으로 미리 학습된 ResNet-101 백본을 미세조정하여 이미지의 깊이 있는 컨volutional 특징을 추출한다.
  • MS-COCO 데이터셋으로 훈련된 LSTM 기반 언어 모델을 사용하여 이미지 캡션을 생성하여 의미적으로 풍부한 텍스트 기술서를 생성한다.
  • 스킵-사고트 모델을 사용하여 생성된 캡션과 사용자 쿼리를 조밀한 벡터 표현으로 인코딩하여 의미 유사도 계산을 가능하게 한다.
  • 쿼리 임베딩과 데이터셋 내 이미지의 캡션 임베딩 간의 L2 거리 최소화를 통해 이미지 검색을 수행한다.
  • 이미지와 그에 해당하는 캡션을 함께 공유된 의미 공간에 임베딩하는 엔드 투 엔드 임베딩 공간 검색 방법을 구현한다. 이는 시아미즈 유사 아키텍처를 사용한다.
  • 대조 손실 목표함수를 최적화하여 임베딩 공간 내에서 양성 이미지-텍스트 쌍은 가까이, 음성 쌍은 멀리 떨어지도록 한다.

실험 결과

연구 질문

  • RQ1텍스트 기반 쿼리 시스템이 기존의 이미지 기반 또는 키워드 기반 이미지 검색보다 의미적 관련성과 사용자 표현력 측면에서 뛰어나게 성능을 낼 수 있는가?
  • RQ2스킵-사고트 벡터 모델이 이미지 캡션에서 의미를 효과적으로 포착하여 후속 검색 작업에 기여하는가?
  • RQ3이미지와 캡션을 공유된 공간에 공동으로 임베딩하는 것이 캡션 기반 검색만을 사용할 때보다 검색 정확도를 향상시키는가?
  • RQ4정밀도@1 대비 정밀도@5와 같은 검색 메트릭의 선택이 의미 기반 이미지 검색 모델의 진정된 성능을 얼마나 잘 반영하는가?

주요 결과

  • 임베딩 공간 검색(ESR) 방법은 상위 5개 검색에서 91.2%의 정밀도@5를 기록했으며, 상위 1개 정밀도는 낮아도 캡션 기반 검색(CBR)보다 상위 5개 정확도에서 뛰어난 성능을 보였다.
  • 캡션 기반 검색는 상위 1개 정밀도(72.9%)에서 임베딩 기반 검색(68.3%)보다 더 높은 성능을 보였으며, 최상위 결과의 초기 순위 정확도가 뛰어나다는 것을 시사한다.
  • 스킵-사고트 모델은 이미지 캡션을 의미 있는 벡터 표현으로 효과적으로 인코딩하여 의미적으로 관련된 쿼리와 이미지 간의 높은 의미 유사도를 가능하게 했다.
  • 시스템은 강력한 정성적 성능을 보였으며, 객체 존재뿐 아니라 의미 관계까지 정확히 반영한 이미지를 검색하는 데 성공했다(예: '개가 텔레비전을 보고 있다').
  • 검색 파이프라인은 GPU 최적화가 되어 있지 않으며, 쿼리당 1.7~2.1초의 타이밍 결과는 하드웨어 가속을 통해 상당한 성능 향상이 가능함을 시사한다.
  • 모델의 성능은 표준 메트릭(BLEU, METEOR, ROUGE-L, CIDEr)을 사용하여 MS-COCO 데이터셋에서 정량적으로 평가되었으며, 최신 기술 수준의 캡션 생성 모델들과 경쟁 가능한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.