Skip to main content
QUICK REVIEW

[논문 리뷰] VSE-ens: Visual-Semantic Embeddings with Efficient Negative Sampling

Guibing Guo, Songlin Zhai|arXiv (Cornell University)|2018. 01. 05.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 시각-언어 임bedding(VSE) 학습을 가속화하기 위해 순서 유지 변환를 사용하여 높은 순위의 음성 예제를 선택함으로써 시간 복잡도를 감소시키면서 순위 정확도를 손상시키지 않는 빠른 적응형 음성 샘플러인 VSE-ens를 제안한다. OpenImages에서 최신 기술 대비 최대 5.02배 빠른 수렴을 달성하며, IAPR-TCI2와 NUS-WIDE에서도 일관된 속도 향상을 보이며 성능을 유지하거나 향상시킨다.

ABSTRACT

Jointing visual-semantic embeddings (VSE) have become a research hotpot for the task of image annotation, which suffers from the issue of semantic gap, i.e., the gap between images' visual features (low-level) and labels' semantic features (high-level). This issue will be even more challenging if visual features cannot be retrieved from images, that is, when images are only denoted by numerical IDs as given in some real datasets. The typical way of existing VSE methods is to perform a uniform sampling method for negative examples that violate the ranking order against positive examples, which requires a time-consuming search in the whole label space. In this paper, we propose a fast adaptive negative sampler that can work well in the settings of no figure pixels available. Our sampling strategy is to choose the negative examples that are most likely to meet the requirements of violation according to the latent factors of images. In this way, our approach can linearly scale up to large datasets. The experiments demonstrate that our approach converges 5.02x faster than the state-of-the-art approaches on OpenImages, 2.5x on IAPR-TCI2 and 2.06x on NUS-WIDE datasets, as well as better ranking accuracy across datasets.

연구 동기 및 목표

  • 이미지가 픽셀 수준의 특징을 가지지 않을 경우 시각-언어 임bedding(VSE) 학습에서 균일한 음성 샘플링의 비효율성을 해결한다.
  • 전체 레이블 공간 탐색이 계산적으로 비현실적인 대규모 데이터셋에서 음성 샘플링의 시간 복잡도를 감소시킨다.
  • 비용이 많이 드는 내적 계산 없이도 높은 순위의 음성 예제를 동적으로 선택할 수 있는 샘플링 전략을 개발한다.
  • 기존 내적 기반 샘플링과 이론적으로 동일한 최적화 목표를 유지하면서 학습 속도를 크게 향상시킨다.
  • 이미지가 픽셀 데이터가 아닌 수치적 ID로만 표현되는 실세계 환경에서 효율적이고 확장 가능한 VSE 학습을 가능하게 한다.

제안 방법

  • 양성 쌍에 대해 순서가 어긋나는 것을 가장 잘 일으킬 음성 예제를 식별하기 위해 순서 유지 변환를 제안한다.
  • 레이블 공간 전체를 순회하지 않고도 이미지와 레이블의 잠재 요소를 기반으로 음성 레이블을 선택한다.
  • 상대적 순위 순서를 유지하는 변환으로 비용이 많이 드는 내적 연산을 대체한다.
  • 적응형 샘플러를 VSE 프레임워크에 통합하여 빠르고 확장 가능하며 정확한 동시 임베딩 학습을 가능하게 한다.
  • 이론적 증명을 통해 제안된 샘플링 전략이 최적화 목표 측면에서 기존 내적 기반 샘플링과 동일하다고 확인한다.
  • 현재 임bedding 상태에 따라 음성 샘플 선택을 동적으로 조정함으로써 효율적인 온라인 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1시각-언어 임bedding에서 순위 정확도를 손상시키지 않고 음성 샘플링을 가속화할 수 있는가?
  • RQ2시각적 특징이 제공되지 않고 이미지 ID만 제공될 경우 음성 예제를 효율적으로 선택할 수 있는가?
  • RQ3잠재 요소와 순서 유지 변환를 활용해 음성 샘플링의 시간 복잡도를 낮출 수 있는가?
  • RQ4제안된 적응형 샘플링 전략이 기존 내적 기반 샘플링과 이론적으로 동일한가?
  • RQ5고차원 레이블 공간을 가진 대규모 데이터셋에서 제안된 방법은 어떻게 확장 가능한가?

주요 결과

  • VSE-ens는 OpenImages 데이터셋에서 최신 기술 대비 최대 5.02배 빠른 학습 수렴을 달성한다.
  • IAPR-TCI2 데이터셋에서는 학습 시간을 2.5배 감소시키고, NUS-WIDE 데이터셋에서는 2.06배 감소시킨다.
  • 속도 향상에도 불구하고, 모든 평가된 데이터셋에서 순위 정확도를 유지하거나 향상시킨다.
  • 이론적 분석을 통해 적응형 샘플링 전략이 최적화 목표 측면에서 기존 내적 기반 샘플링과 동일하다고 확인된다.
  • 데이터셋 크기와 선형적으로 확장 가능하므로 대규모 이미지 레이블링 작업에 적합하다.
  • 픽셀 수준의 특징이 없이 수치적 ID로만 표현되는 이미지에서도 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.