Skip to main content
QUICK REVIEW

[논문 리뷰] Bi-Directional Domain Translation for Zero-Shot Sketch-Based Image Retrieval

Jiangtong Li, Zhixin Ling|arXiv (Cornell University)|2019. 11. 29.
Advanced Image and Video Retrieval Techniques참고 문헌 59인용 수 4
한 줄 요약

이 논문은 제로샷 스케치 기반 이미지 검색(ZS-SBIR)을 위한 양방향 도메인 번역(BDT) 프레임워크를 제안하며, 이미지 특징을 구조와 외관 성분으로 분리하여 도메인 간 번역과 구조 기반 검색을 가능하게 한다. 이 방법은 기존 접근 방식에 비해 Sketchy에서 약 8% 향상된 검색 정확도와 TU-Berlin에서 5% 이상 향상된 성능을 달성하여 최신 기술 수준을 확립한다.

ABSTRACT

The goal of Sketch-Based Image Retrieval (SBIR) is using free-hand sketches to retrieve images of the same category from a natural image gallery. However, SBIR requires all categories to be seen during training, which cannot be guaranteed in real-world applications. So we investigate more challenging Zero-Shot SBIR (ZS-SBIR), in which test categories do not appear in the training stage. Traditional SBIR methods are prone to be category-based retrieval and cannot generalize well from seen categories to unseen ones. In contrast, we disentangle image features into structure features and appearance features to facilitate structure-based retrieval. To assist feature disentanglement and take full advantage of disentangled information, we propose a Bi-directional Domain Translation (BDT) framework for ZS-SBIR, in which the image domain and sketch domain can be translated to each other through disentangled structure and appearance features. Finally, we perform retrieval in both structure feature space and image feature space. Extensive experiments demonstrate that our proposed approach remarkably outperforms state-of-the-art approaches by about 8% on the Sketchy dataset and over 5% on the TU-Berlin dataset.

연구 동기 및 목표

  • 학습 중에 볼 수 없었던 테스트 카테고리가 존재하는 제로샷 스케치 기반 이미지 검색의 과제를 해결하기 위해.
  • 기존 SBIR 방법에서 카테고리 기반 검색의 한계로 인해 새로운 카테고리로의 일반화에 실패하는 문제를 극복하기 위해.
  • 이미지 특징을 구조와 외관 성분으로 분리하여 도메인 간 효과적인 검색을 가능하게 하기 위해.
  • 분리된 특징을 활용해 스케치와 이미지 도메인 간 상호 번역을 수행하는 이중 방향 번역 프레임워크를 개발하기 위해.
  • 통합된 프레임워크에서 구조 및 이미지 특징 공간을 모두 활용하여 검색 성능을 향상시키기 위해.

제안 방법

  • 분리 모듈을 사용하여 이미지 특징을 구조 및 외관 성분으로 분리하기 위해.
  • 분리된 특징을 활용해 스케치와 이미지 도메인 간 상호 번역을 수행하는 이중 방향 도메인 번역 프레임워크를 설계하기 위해.
  • 분리된 성분에서 이미지와 스케치를 재구성하도록 모델을 훈련하여 도메인 간 일관성을 강제하기 위해.
  • 일반화 성능을 향상시키기 위해 구조 특징 공간과 이미지 특징 공간에서 모두 검색을 수행하기 위해.
  • 번역된 특징의 품질과 정렬을 향상시키기 위해 adversarial 훈련과 사이클 일관성 손실을 사용하기 위해.
  • 엔드 투 엔드 학습을 통해 분리 및 번역 구성 요소를 공동 최적화하기 위해.

실험 결과

연구 질문

  • RQ1분리된 구조 및 외관 특징은 스케치 기반 이미지 검색에서 제로샷 일반화를 향상시키는가?
  • RQ2이중 방향 도메인 번역은 새로운 카테고리에 대해 스케치와 이미지 도메인을 효과적으로 정렬하는가?
  • RQ3제로샷 환경에서 구조 기반 검색이 카테고리 기반 검색보다 우수한가?
  • RQ4분리 및 번역의 공동 최적화는 검색 정확도 향상에 어느 정도 기여하는가?
  • RQ5기준 데이터셋에서 제안된 방법은 최신 기술 수준의 접근 방식과 비교해 어떻게 성능을 내는가?

주요 결과

  • 제안된 BDT 프레임워크는 Sketchy 데이터셋에서 최신 기술 수준의 방법에 비해 약 8% 향상된 성능을 달성한다.
  • TU-Berlin 데이터셋에서는 기존 접근 방식에 비해 검색 성능을 5% 이상 향상시킨다.
  • 구조 및 외관 특징의 분리로 인해 제로샷 환경에서 새로운 카테고리로의 일반화가 향상된다.
  • 구조 특징 공간과 이미지 특징 공간에서 모두 검색을 수행함으로써, 단일 공간을 사용하는 것보다 더 견고하고 정확한 결과를 도출한다.
  • 이중 방향 번역 메커니즘이 스케치와 이미지 간 의미적 및 구조적 일관성을 효과적으로 유지한다.
  • 모델는 강력한 제로샷 일반화 능력을 보이며, 훈련 중에 볼 수 없었던 카테고리의 이미지도 효과적으로 검색할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.