Skip to main content
QUICK REVIEW

[논문 리뷰] Attention-based Ensemble for Deep Metric Learning

Wonsik Kim, Bhavya Goyal|arXiv (Cornell University)|2018. 04. 02.
Advanced Image and Video Retrieval Techniques참고 문헌 34인용 수 22
한 줄 요약

이 논문은 서로 다른 주의 맵을 사용해 각기 다른 이미지 영역에 집중하도록 훈련하는 다수의 학습자로 구성된 주의 기반 앙상블(ABE-M)을 제안한다. 이는 주의 기반 앙상블을 통해 모델의 다양성을 향상시키며, 주의 기반 특징 간의 비유사성을 더욱 강화하기 위해 분산 손실을 도입함으로써 CARS-196, CUB-200-2011, SOP, 그리고 in-shop 옷 검색 벤치마크에서 최신 기술(SOTA) 성능을 달성한다. 이는 기존 앙상블 기반 모델보다 파rameter 수가 적다.

ABSTRACT

Deep metric learning aims to learn an embedding function, modeled as deep neural network. This embedding function usually puts semantically similar images close while dissimilar images far from each other in the learned embedding space. Recently, ensemble has been applied to deep metric learning to yield state-of-the-art results. As one important aspect of ensemble, the learners should be diverse in their feature embeddings. To this end, we propose an attention-based ensemble, which uses multiple attention masks, so that each learner can attend to different parts of the object. We also propose a divergence loss, which encourages diversity among the learners. The proposed method is applied to the standard benchmarks of deep metric learning and experimental results show that it outperforms the state-of-the-art methods by a significant margin on image retrieval tasks.

연구 동기 및 목표

  • 모델 앙상블를 통해 특징 다양성을 향상시켜 딥 메트릭 학습 성능을 향상시키는 것.
  • 앙상블 구성원 간의 특징 임베딩에서 다양성을 유도하기 위한 아키텍처 설계의 부족을 해결하는 것.
  • 모델 크기를 줄이면서도 높은 성능을 유지하는 파rameter 효율적인 앙상블 프레임워크를 개발하는 것.
  • 주의 기반 주의 맵과 분산 손실이 개별 및 앙상블 모델 성능을 함께 향상시킬 수 있음을 검증하는 것.

제안 방법

  • 공유 백본 네트워크를 사용하는 M방향 주의 기반 앙상블(ABE-M)을 적용하며, 각기 다른 입력 이미지 영역에 집중하도록 M개의 별도 주의 모듈을 학습시킨다.
  • 각 주의 모듈은 객체의 다른 부분에 주의를 기울여 고유한 특징 표현을 생성함으로써 학습된 임베딩의 다양성을 증진시킨다.
  • 다른 학습자 간의 주의 맵 유사성을 최소화하기 위해 분산 손실을 도입하여, 서로 다른 이미지 영역에 집중하도록 유도한다.
  • 표준 메트릭 학습 손실(예: 트리플릿 또는 대비 손실)과 제안된 분산 손실을 결합하여 종합적으로 엔드 투 엔드로 훈련한다.
  • 모든 학습자 간에 초기 합성곱 레이어를 공유함으로써 파rameter 수를 줄이면서도 높은 성능을 유지한다.
  • 표준 벤치마크인 CARS-196, CUB-200-2011, SOP, 그리고 in-shop 옷 검색을 대상으로 평가한다.

실험 결과

연구 질문

  • RQ1다양한 학습자 간 주의 기반 특징 선택이 딥 메트릭 학습 성능 향상에 기여하는가?
  • RQ2주의 맵의 다양성을 명시적으로 유도하면 일반화 성능과 더 높은 검색 정확도를 달성하는가?
  • RQ3주의 모듈을 갖춘 공유 백본 앙상블이 더 적은 파rameter로 표준 M헤드 앙상블을 능가하는가?
  • RQ4제안된 분산 손실이 개별 학습자 성능과 앙상블 정확도를 모두 향상시키는가?

주요 결과

  • 512차원 특징을 사용한 ABE-8은 in-shop 옷 검색 데이터셋에서 Recall@50가 98.7%를 기록하여 이전 SOTA인 A-BIER보다 0.3% 높았다.
  • CUB-200-2011(cropped)에서 ABE-8은 Recall@30가 92.2%를 기록하여 A-BIER(92.1%)와 Margin(90.6%)를 초월했다.
  • SOP에서 ABE-8은 Recall@1000가 98.2%를 기록하여 A-BIER(97.8%)와 Margin(98.0%)를 뛰어넘었다.
  • CARS-196(cropped)에서 ABE-8은 Recall@8가 95.5%를 기록하여 A-BIER(95.6%)와 HDC(93.8%)를 능가했다.
  • 제안된 ABE-4와 ABE-8 모델는 파rameter 수가 적은데도 M헤드 기반 베이스라인보다 높은 성능을 달성했다.
  • 분산 손실은 개별 모델 성능과 앙상블 정확도를 모두 향상시켜 특징 다양성을 증진시키는 데 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.