Skip to main content
QUICK REVIEW

[논문 리뷰] Query by Semantic Sketch

Luca Rossetto, Ralph Gasser|arXiv (Cornell University)|2019. 09. 27.
Advanced Image and Video Retrieval Techniques참고 문헌 33인용 수 5
한 줄 요약

이 논문은 사용자가 2차원 캔버스에 의미 개념(예: '하늘' 또는 '사람')의 공간 분포를 그림으로 그려 다중미디어 컬렉션을 쿼리할 수 있는 스케치 기반 시각 검색 방법을 제안한다. 딥 뉴럴 네트워크가 생성한 개념 맵과 사전 학습된 워드 임베딩에서 유도된 압축된 벡터 표현을 사용하여, 특수한 색인 구조가 필요 없이 효율적인 kNN 기반 검색을 지원하며, 저장 공간 절약 효과가 크다.

ABSTRACT

Sketch-based query formulation is very common in image and video retrieval as these techniques often complement textual retrieval methods that are based on either manual or machine generated annotations. In this paper, we present a retrieval approach that allows to query visual media collections by sketching concept maps, thereby merging sketch-based retrieval with the search for semantic labels. Users can draw a spatial distribution of different concept labels, such as "sky", "sea" or "person" and then use these sketches to find images or video scenes that exhibit a similar distribution of these concepts. Hence, this approach does not only take the semantic concepts themselves into account, but also their semantic relations as well as their spatial context. The efficient vector representation enables efficient retrieval even in large multimedia collections. We have integrated the semantic sketch query mode into our retrieval engine vitrivr and demonstrated its effectiveness.

연구 동기 및 목표

  • 대규모 다중미디어 컬렉션에서 전통적인 텍스트 기반 및 저수준 기능 기반 이미지 검색의 한계를 해결한다.
  • 의미적 의미와 개념 간의 공간적 관계를 통합하여 스케치 기반 검색의 과제를 극복한다.
  • 압축된 벡터 표현을 통해 전용 색인 구조가 필요 없이 효율적이고 확장 가능한 검색을 가능하게 한다.
  • 기존 신경망을 재학습하지 않고도 새로운 의미 클래스를 동적으로 추가할 수 있도록 한다.
  • vitrivr 검색 엔진을 사용하여 대규모 영상 데이터셋(V3C1)에서 제안된 방법의 실현 가능성과 성능을 입증한다.

제안 방법

  • 딥 뉴럴 네트워크를 사용하여 입력 이미지에서 의미 개념(예: '사람', '하늘')을 픽셀 수준에서 검출하여 개념 맵을 생성한다.
  • 각 의미 개념을 사전 학습된 word2vec 임베딩으로 표현하며, t-SNE를 통해 저차원 공간으로 투영하여 압축성을 확보한다.
  • 이미지를 격자(예: 8x8, 16x16, 32x32)로 나누고 각 격자 셀의 평균 임베딩을 계산하여 공간 정보를 집계한다.
  • 최종 벡터 표현의 크기를 $ n^2 d $ 로 구성한다. 여기서 $ n $ 은 격자 크기이고 $ d $ 는 의미 임베딩의 차원이다.
  • 사용자가 색상 레이블을 사용해 2차원 캔버스에 개념 분포를 스케치할 수 있도록 허용하며, 이를 동일한 벡터 공간으로 변환한다.
  • 압축된 벡터 표현을 기반으로 L1 거리 메트릭을 사용한 맨해튼 거리 기반 kNN 검색을 수행한다.

실험 결과

연구 질문

  • RQ1압축된 벡터 표현이 의미 개념과 그 공간 분포를 효과적으로 인코딩하여 효율적인 스케치 기반 검색을 가능하게 할 수 있는가?
  • RQ2대규모 다중미디어 컬렉션에서 저장 공간 효율성과 검색 성능 측면에서 기존 방법과 비교해 제안된 방법은 어떠한가?
  • RQ3기존 신경망 분류기를 재학습하지 않고도 새로운 의미 클래스를 얼마나 잘 추가할 수 있는가?
  • RQ4고립된 개념 검출에 의존하는 방법과 비교해 공간적 및 의미적 관계를 통합함으로써 검색 정확도가 향상되는가?
  • RQ5대규모 환경에서도 특수 색인 구조가 필요 없이 빠른 검색을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 설정 파rameter에 따라 기준 방법의 저장 요구량을 최대 4.2%까지 줄일 수 있다.
  • 1,046,235개의 벡터를 포함하는 V3C1 데이터셋에서, 단순 선형 kNN 검색 평균 소요 시간은 974ms로 상호작용적 사용에 적합함을 입증했다.
  • 사전 계산된 워드 임베딩 덕분에 기존 신경망 분류기를 재학습하지 않고도 새로운 의미 클래스를 동적으로 추가할 수 있다.
  • 벡터 표현은 개념 간 의미 유사성과 공간적 레이아웃을 모두 유지하므로 더 정확하고 맥락 인식 기반의 검색이 가능하다.
  • 표준 kNN와 L1 거리 기반 검색만으로도 효율적인 검색을 구현하여 전용 색인 구조가 필요 없음을 입증했다.
  • 이 방법은 성공적으로 vitrivr 검색 엔진에 통합되었으며, 공개 현장 테스트에서 기술적 실현 가능성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.