[논문 리뷰] Deep Metric Learning by Online Soft Mining and Class-Aware Attention
이 논문은 모든 샘플에 연속적인 점수를 부여함으로써 유용한 정보를 극대화하고 이상치의 영향을 줄이며, 딥 메트릭 학습을 향상시키기 위해 온라인 소프트 마이닝(Online Soft Mining, OSM)과 클래스 인식 주의( Class-Aware Attention, CAA)를 제안한다. OSM의 소프트 마이닝과 CAA의 이상치 억제를 결합함으로써, 미세한 이미지 인식 및 비디오 기반 인물 재식별 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, MARS에서 mAP가 최대 4.9% 향상되었다.
Deep metric learning aims to learn a deep embedding that can capture the semantic similarity of data points. Given the availability of massive training samples, deep metric learning is known to suffer from slow convergence due to a large fraction of trivial samples. Therefore, most existing methods generally resort to sample mining strategies for selecting nontrivial samples to accelerate convergence and improve performance. In this work, we identify two critical limitations of the sample mining methods, and provide solutions for both of them. First, previous mining methods assign one binary score to each sample, i.e., dropping or keeping it, so they only selects a subset of relevant samples in a mini-batch. Therefore, we propose a novel sample mining method, called Online Soft Mining (OSM), which assigns one continuous score to each sample to make use of all samples in the mini-batch. OSM learns extended manifolds that preserve useful intraclass variances by focusing on more similar positives. Second, the existing methods are easily influenced by outliers as they are generally included in the mined subset. To address this, we introduce Class-Aware Attention (CAA) that assigns little attention to abnormal data samples. Furthermore, by combining OSM and CAA, we propose a novel weighted contrastive loss to learn discriminative embeddings. Extensive experiments on two fine-grained visual categorisation datasets and two video-based person re-identification benchmarks show that our method significantly outperforms the state-of-the-art.
연구 동기 및 목표
- 대규모 데이터셋에서 포함된 단순 샘플들로 인해 딥 메트릭 학습의 수렴 속도가 느려지는 문제를 해결하기 위해.
- 기존의 샘플 마이닝 방법이 이질적인 유용한 샘플을 이진(하드) 마이닝을 통해 폐기하는 데서 비롯되는 한계를 극복하기 위해.
- 마이닝된 훈련 샘플 내의 이상치가 모델 성능을 떨어뜨리는 부정적 영향을 완화하기 위해.
- 기존 메트릭 학습 프레임워크와 호환되는 일반적이고 플러그인 방식의 솔루션을 개발하기 위해.
- OSM와 CAA를 통합한 새로운 가중 대비 손실 함수를 통해 분류 가능한 임bedding 학습을 향상시키기 위해.
제안 방법
- 모든 샘플에 이진 선택 대신 연속적인 마이닝 점수를 할당함으로써 배치 내 정보를 극대화하는 온라인 소프트 마이닝(Online Soft Mining, OSM)을 제안한다.
- 임베딩 공간에서 유클리드 거리 기반으로 더 유사한 양성 쌍에 더 높은 점수를 할당함으로써 소프트 양성 마이닝을 구현하며, 내부 클래스 변동성을 유지한다.
- 손실이 더 큰 쌍에 더 높은 점수를 할당함으로써 더 어려운 음성 쌍을 우선순위로 지정하는 소프트 음성 마이닝을 도입하며, 하드 마이닝을 일반화한다.
- 클래스 호환성 기반으로 주의 점수를 계산하여 이상치를 낮은 주의 가중치를 할당함으로써 억제하는 클래스 인식 주의(Class-Aware Attention, CAA)를 제안한다.
- OSM 점수와 CAA 주의 점수의 곱으로 구성된 가중치를 사용하여 OSM과 CAA를 통합한 가중 대비 손실 함수를 개발한다.
- 이 방법은 대비, 트리플릿, 또는 퀠터플렛 손실을 사용하는 기존 메트릭 학습 프레임워크에 쉽게 통합될 수 있다.
실험 결과
연구 질문
- RQ1딥 메트릭 학습에서 이진 하드 마이닝 대비 연속적인 마이닝 점수는 모델 수렴과 성능 향상에 기여하는가?
- RQ2소프트 양성 마이닝을 통한 내부 클래스 변동성 유지가 미세한 인식 작업에서 보다 우수한 일반화 성능을 이끌어내는가?
- RQ3이상치가 메트릭 학습에서 성능에 미치는 영향은 어느 정도이며, 훈련 중에 효과적으로 억제될 수 있는가?
- RQ4소프트 마이닝과 이상치 주의를 통합한 통합 프레임워크가 다양한 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ5OSM와 CAA의 통합은 이미지 기반 및 비디오 기반 인물 재식별 작업에서 성능에 어떤 영향을 미치는가?
주요 결과
- CUB-200-2011 데이터셋에서 제안된 방법은 CMC-1 정확도 77.5%를 달성하여 베이스라인 대비 5.5% 포인트 향상되었다.
- MARS 데이터셋에서 방법은 최신 기술 수준의 CAE 방법 대비 mAP 4.9% 향상 및 CMC-1 2.3% 향상되었다.
- 더 도전적인 LPW 데이터셋에서 방법은 CMC-1 84.7%를 달성하여 비교된 모든 방법보다 뚜렷이 뛰어났다.
- 절단 실험을 통해 OSM만으로도 베이스라인 대비 1-2% 성능 향상이 확인되었으며, CAA를 추가하면 추가로 1-2%의 성능 향상이 있었다.
- 사전 학습된 GoogleNet 가중치를 사용할 경우, 베이스라인 모델은 CUB-200-2011에서 CMC-1 47.8%를 기록했지만, 제안된 방법은 이를 7% 이상 초월하였다.
- OSM와 CAA의 통합은 모든 데이터셋에서 일관된 성능 향상을 이끌어내어 강건성과 일반화 능력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.