Skip to main content
QUICK REVIEW

[논문 리뷰] Hybrid-Attention based Decoupled Metric Learning for Zero-Shot Image Retrieval

Binghui Chen, Weihong Deng|arXiv (Cornell University)|2019. 07. 27.
Domain Adaptation and Few-Shot Learning참고 문헌 39인용 수 6
한 줄 요약

이 논문은 제로샷 이미지 검색에서 특징의 분류 능력과 일반화 능력을 향상시키기 위해 통합된 메트릭 학습을 개체 주의 및 채널 주의 하위학습자로 분리하는 하이브리드 주의 기반 프레임워크인 디커플드 메트릭 러닝(DeML)을 제안한다. 무작위 보행 기반의 개체 주의와 적대적 채널 주의를 사용함으로써 DeML은 CUB, CARS, 스탠포드 온라인 프로덕츠, In-Shop에서 최신 기술을 상당한 격차로 능가하며, 더 높은 강건성과 낮은 신경망 중복을 보여준다.

ABSTRACT

In zero-shot image retrieval (ZSIR) task, embedding learning becomes more attractive, however, many methods follow the traditional metric learning idea and omit the problems behind zero-shot settings. In this paper, we first emphasize the importance of learning visual discriminative metric and preventing the partial/selective learning behavior of learner in ZSIR, and then propose the Decoupled Metric Learning (DeML) framework to achieve these individually. Instead of coarsely optimizing an unified metric, we decouple it into multiple attention-specific parts so as to recurrently induce the discrimination and explicitly enhance the generalization. And they are mainly achieved by our object-attention module based on random walk graph propagation and the channel-attention module based on the adversary constraint, respectively. We demonstrate the necessity of addressing the vital problems in ZSIR on the popular benchmarks, outperforming the state-of-theart methods by a significant margin. Code is available at http://www.bhchen.cn

연구 동기 및 목표

  • 제로샷 이미지 검색(ZSIR)에서 시각적 입력의 분류 능력 부족과 국소적/선택적 학습 행동이라는 핵심 문제를 해결함으로써, 메트릭의 분류 능력과 일반화 능력 향상을 도모하고자 한다.
  • 통합된 메트릭 러닝을 주의 특화 하위학습자로 분리하여 특징의 분류 능력을 명시적으로 향상시키고 다양성을 증진하고자 한다.
  • 다양한 주의 헤드 간 상호 보완 지식 학습을 유도함으로써, 학습된 카테고리에 대한 과적합과 신경망 중복을 완화하고자 한다.
  • 어려운 샘플 채굴이나 복잡한 샘플 쌍 구성에 의존하지 않는 모델에 종속되지 않는 프레임워크를 개발하고자 한다.
  • 명시적인 메트릭 러닝 분리가 제로샷 일반화를 향상시키는 데 필수적이고 효과적인지 검증하고자 한다.

제안 방법

  • DeML은 최종 완전 연결 층을 다수의 개체 주의 루트-학습자와 채널 주의 하위학습자로 분리하여 주의 특화 학습을 가능하게 한다.
  • 개체 주의 모듈(OAMs)은 무작위 보행 기반 그래프 전파를 통해 자동으로 주목할 만한 시각적 영역을 식별하여 특징의 분류 능력을 향상시킨다.
  • 채널 주의 모듈(CAMs)은 적대적 손실($L_{adv}$)로 제약을 두어 다양성을 유도하고, 모든 학습자가 동일한 쉬운 특징에 집중하는 것을 방지한다.
  • 프레임워크는 자르기와 줌 인/아웃의 병합 연산을 사용하여 다중 해상도 특징을 생성함으로써 국소화 및 표현 능력을 향상시킨다.
  • 이 방법은 모델에 종속되지 않으며 기존의 딥 메트릭 러닝 파ipeline에 쉽게 통합 가능한 드롭인 모듈로 활용할 수 있다.
  • 최종 표현은 다수의 주의 특화 학습자로부터의 예측을 집계함으로써 강건성과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1비분류 시각적 입력은 제로샷 이미지 검색에서 특징의 분류 능력에 어떤 영향을 미치는가?
  • RQ2딥 러닝 모델에서의 국소적/선택적 학습 행동은 미지 클래스로의 일반화 능력을 얼마나 악화시키는가?
  • RQ3통합된 메트릭 러닝을 주의 특화 하위학습자로 분리하는 것이 ZSIR에서 분류 능력과 일반화 능력을 향상시키는 데 효과적인가?
  • RQ4채널 주의 모듈에 대한 적대적 제약은 실제로 신경망 중복을 줄이고 특징 다양성을 향상시키는가?
  • RQ5제안된 DeML 프레임워크는 여러 벤치마크에서 최신 기술 대비 검색 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • DeML(I=1, J=8)는 CUB에서 59.0% R@1, CARS에서 82.5% R@1을 기록하여 베이스라인 U512(50.9% 및 67.1%) 및 기타 최신 기술을 상당히 앞서며 성능을 냈다.
  • 적대적 손실($L_{adv}$)이 없을 경우 DeML의 성능은 CUB에서 52.0% R@1, CARS에서 68.2% R@1로 급격히 떨어지며 다양성 강제의 핵심적 역할을 확인했다.
  • $L_{adv}$ 제거 시 채널 주의 학습자 간 코사인 유사도는 -0.09에서 0.92로 증가하여, 손실이 중복을 효과적으로 줄이고 보완적 학습을 촉진함을 확인했다.
  • 8개의 채널 주의 학습자조차도 $L_{adv}$ 없이선 성능이 낮게 유지되며, 독립적 감독이 유사한 특징에 과적합하게 하고 일반화 능력을 향상시키지 못함을 보여준다.
  • Stanford Online Products에서는 DeML(I=2, J=4)가 충분하며, 두 번째 스케일에서 이미 분류 가능한 영역를 효과적으로 국소화한다.
  • 제거 분석 결과, 개체 주의 및 채널 주의 모듈이 모두 필요하며, 이들의 조합이 모든 데이터셋에서 최고의 성능을 낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.