Skip to main content
QUICK REVIEW

[논문 리뷰] Image Hashing by Minimizing Discrete Component-wise Wasserstein Distance

Khoa D. Doan, Saurav Manchanda|arXiv (Cornell University)|2020. 02. 29.
Advanced Image and Video Retrieval Techniques참고 문헌 33인용 수 4
한 줄 요약

이 논문은 이미지 해싱을 위한 새로운 적대적 autoencoder인 이산 성분별 워샤르스키 자동기계(DCW-AE)를 제안한다. 이는 더 일반화 가능한 성분별 변형 워샤르스키 거리의 최소화를 통해, 해시 코드의 이산적 성질을 활용하여 표본 복잡도와 계산 효율성을 크게 향상시킨다. 이로 인해 기존 방법 대비 최대 10% 향상된 최신 기술 수준의 검색 성능을 달성한다.

ABSTRACT

Image hashing is one of the fundamental problems that demand both efficient and effective solutions for various practical scenarios. Adversarial autoencoders are shown to be able to implicitly learn a robust, locality-preserving hash function that generates balanced and high-quality hash codes. However, the existing adversarial hashing methods are inefficient to be employed for large-scale image retrieval applications. Specifically, they require an exponential number of samples to be able to generate optimal hash codes and a significantly high computational cost to train. In this paper, we show that the high sample-complexity requirement often results in sub-optimal retrieval performance of the adversarial hashing methods. To address this challenge, we propose a new adversarial-autoencoder hashing approach that has a much lower sample requirement and computational cost. Specifically, by exploiting the desired properties of the hash function in the low-dimensional, discrete space, our method efficiently estimates a better variant of Wasserstein distance by averaging a set of easy-to-compute one-dimensional Wasserstein distances. The resulting hashing approach has an order-of-magnitude better sample complexity, thus better generalization property, compared to the other adversarial hashing methods. In addition, the computational cost is significantly reduced using our approach. We conduct experiments on several real-world datasets and show that the proposed method outperforms the competing hashing methods, achieving up to 10% improvement over the current state-of-the-art image hashing methods. The code accompanying this paper is available on Github (https://github.com/khoadoan/adversarial-hashing).

연구 동기 및 목표

  • 기존 적대적 autoencoder 기반 해싱 방법의 낮은 일반화 능력과 높은 계산 비용 문제를 해결하기 위해.
  • 이미지 해싱에서 워샤르스키 기반 적대적 학습의 표본 복잡도를 감소시키기 위해.
  • 더 안정적이고 효율적인 발산 최소화 프레임워크를 학습함으로써 검색 성능을 향상시키기 위해.
  • 해시 코드 최적화에서의 히وري스틱 제약 조건을 암묵적 분포 매칭을 통해 제거하기 위해.
  • 대규모 응용을 위한 확장 가능하고 효율적이며 고성능인 비지도 이미지 해싱 모델을 개발하기 위해.

제안 방법

  • 원천 및 목표 분포가 가장 다를 수 있는 방향에 따라 일련의 1차원 워샤르스키 거리의 평균을 계산함으로써 워샤르스키 거리를 추정하는 새로운 기법을 도입한다.
  • 이진 해시 코드의 이산적 성질을 활용하여 표준 워샤르스키 거리보다 더 일반화 가능하고 최적화가 쉬운 성분별 워샤르스키 거리를 구성한다.
  • 학습된 해시 코드 분포를 목표 이산 사전 분포와 일치시키기 위해 적대적 학습을 사용하며, 명시적 제약 없이 국소성 유지 해시 함수를 암묵적으로 학습한다.
  • 무작위 투영을 사용하여 거리 추정을 효율적으로 계산함으로써 학습 중 빠른 수렴과 안정된 기울기를 달성한다.
  • 스토하스틱 그래디언트 디센트와 미니배치를 사용해 학습하는 변동형 자동기계(Variational Autoencoder)로 구현된 프레임워크이며, GAN 스타일의 판별기 사용.
  • 이산 워샤르스키 거리의 내재적 성질에 의존함으로써 명시적 정규화 항의 하이퍼파rameter 튜닝이 필요 없도록 한다.

실험 결과

연구 질문

  • RQ1더 일반화 가능한 워샤르스키 거리의 변형이 적대적 autoencoder 기반 이미지 해싱의 표본 효율성과 일반화 능력을 향상시킬 수 있는가?
  • RQ2일련의 1차원 워샤르스키 거리의 성분별 평균화가 해싱을 위한 적대적 학습에서 더 나은 수렴과 안정성을 제공하는가?
  • RQ3제안된 방법이 기존 워샤르스키 기반 적대적 해싱 모델 대비 훨씬 줄어든 학습 시간으로도 뛰어난 검색 성능를 달성할 수 있는가?
  • RQ4표준 워샤르스키 거리와 슬라이스드 워샤르스키 거리와 비교할 때, 제안된 거리 추정 방식은 기울기 안정성과 최적화 역학에서 어떻게 다른가?
  • RQ5해시 코드의 이산적 구조가 잠재 공간에서 더 효율적이고 효과적인 발산 추정을 어떻게 가능하게 하는가?

주요 결과

  • DCW-AE는 다양한 실세계 데이터셋에서 현재 최신 기술 수준의 이미지 해싱 방법보다 최대 10% 높은 검색 성능를 달성한다.
  • 제안된 방법은 기존 적대적 해싱 방법 대비 표본 복잡도에서 수십 배 향상되어 더 적은 학습 샘플로도 더 나은 일반화를 달성할 수 있다.
  • 에포크당 학습 시간이 크게 감소하여, CIFAR10, FlickR25K, PLACE365 데이터셋 전반에서 OT-AE와 WGAN-AE보다 훨씬 더 빠른 속도로 학습된다.
  • 낮은 수의 무작위 투영을 사용할 때도 DCW-AE의 거리 추정치와 기울기 노름이 SWD보다 더 안정적이다.
  • t-SNE 시각화 결과 DCW-AE는 더 구조적이고 분리 가능한 임베딩 공간을 학습함을 보여주며, 4와 9처럼 유사한 숫자를 효과적으로 구분한다.
  • 비적대적 기반 모델(ITQ, DistillHash)과 다른 적대적 모델(OT-AE, SWD-AE)보다 특히 검색 정확도와 강건성 측면에서 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.