Skip to main content
QUICK REVIEW

[논문 리뷰] Label Structure Preserving Contrastive Embedding for Multi-Label Learning with Missing Labels

Zhongchen Ma, Lisha Li|arXiv (Cornell University)|2022. 09. 03.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 라벨 누락 상황에서 다중 레이블 이미지 분류를 위한 새로운 대비 손실인 CLML을 제안한다. CLML은 레이블 보정과 저질서 구조 유지 기능을 통합하여 특징 표현을 향상시킨다. 각 레이블에 대해 진정한 양성 및 음성 인스턴스를 정확히 식별하고 전역 및 국소 레이블 의존성을 유지함으로써, CLML은 MSCOCO, VOC, NUS-WIDE에서 ResNet101 성능을 1.2–1.3% 향상시킨다.

ABSTRACT

Contrastive learning (CL) has shown impressive advances in image representation learning in whichever supervised multi-class classification or unsupervised learning. However, these CL methods fail to be directly adapted to multi-label image classification due to the difficulty in defining the positive and negative instances to contrast a given anchor image in multi-label scenario, let the label missing one alone, implying that borrowing a commonly-used way from contrastive multi-class learning to define them will incur a lot of false negative instances unfavorable for learning. In this paper, with the introduction of a label correction mechanism to identify missing labels, we first elegantly generate positives and negatives for individual semantic labels of an anchor image, then define a unique contrastive loss for multi-label image classification with missing labels (CLML), the loss is able to accurately bring images close to their true positive images and false negative images, far away from their true negative images. Different from existing multi-label CL losses, CLML also preserves low-rank global and local label dependencies in the latent representation space where such dependencies have been shown to be helpful in dealing with missing labels. To the best of our knowledge, this is the first general multi-label CL loss in the missing-label scenario and thus can seamlessly be paired with those losses of any existing multi-label learning methods just via a single hyperparameter. The proposed strategy has been shown to improve the classification performance of the Resnet101 model by margins of 1.2%, 1.6%, and 1.3% respectively on three standard datasets, MSCOCO, VOC, and NUS-WIDE. Code is available at https://github.com/chuangua/ContrastiveLossMLML.

연구 동기 및 목표

  • 학습 중 라벨이 불완전하거나 누락된 상황에서 강건한 다중 레이블 모델을 훈련하는 데 도전하는 것.
  • 표준 대비 학습이 다중 레이블 환경에서 라벨 누락으로 인한 잘못된 음성 예측이 발생하는 한계를 극복하는 것.
  • 라벨 부족 상황에서 임베딩 공간 내 전역 및 국소 레이블 의존성의 저질서 특성을 유지하여 표현 학습을 향상시키는 것.
  • 기존 다중 레이블 학습 프레임워크에 쉽게 통합될 수 있는 일반 목적의 대비 손실을 개발하는 것. 단일 하이퍼파rameter를 통해 구현된다.

제안 방법

  • 학습 중에 누락된 레이블을 추론할 수 있는 레이블 보정 메커니즘을 도입하여, 대비 학습에서 잘못된 음성 예측을 줄인다.
  • 각 의미적 레이블에 대해 인스턴스 수준의 양성 및 음성 쌍을 별도로 정의함으로써, 대비 신호의 정확도를 향상시킨다.
  • 진정한 양성 쌍은 가까이, 진정한 음성 쌍은 멀리 떨어지도록 임베딩 공간에서 조정하는 고유한 대비 손실(CLML)을 제안한다.
  • 전역 및 국소 레이블 구조에 저질서 제약을 통합하여 레이블 간 의미적 관계를 유지한다.
  • 표준 교차 엔트로피 손실(BCE)과 CLML을 결합하여 분류와 대비 표현 학습을 동시에 최적화한다.
  • t-SNE 시각화와 분석 실험을 통해 손실 함수 내 각 구성 요소의 효과를 검증한다.

실험 결과

연구 질문

  • RQ1라벨이 누락된 상황에서 대비 학습을 다중 레이블 이미지 분류에 효과적으로 적용할 수 있는 방법은 무엇인가?
  • RQ2레이블 불완전성 상황에서 레이블 보정 메커니즘이 대비 학습에서 잘못된 음성 인스턴스를 얼마나 줄일 수 있는가?
  • RQ3전역 및 국소 레이블 의존성의 저질서 특성을 유지함으로써, 라벨이 누락된 상황에서도 표현 학습을 향상시킬 수 있는가?
  • RQ4표준 교차 엔트로피 손실 및 다른 대비 손실과 비교할 때, CLML은 표준 벤치마크에서 성능과 견고성 측면에서 어떻게 성과를 내는가?

주요 결과

  • CLML은 각각 MSCOCO, VOC, NUS-WIDE에서 ResNet101의 mAP를 1.2%, 1.6%, 1.3% 향상시켜 기준 모델을 능가한다.
  • 분석 실험 결과, CLML은 모든 평가 지표에서 최고 성능을 기록했으며, VOC에서 mAP(87.2)와 F1 점수(80.3)가 가장 높았다.
  • t-SNE 시각화 결과, CLML는 특히 잘못된 음성 샘플에서의 클래스 내 응집도 향상과 클래스 간 분리도 향상을 확인했다.
  • 레이블 보정 메커니즘이 성공적으로 누락된 레이블을 탐지하고 통합했으며, 임베딩 공간에서 더 넓은 특징 분포가 관찰되었다.
  • 저질서 제약이 군집 품질을 크게 향상시켰으며, t-SNE 그림에서 더 타ight한 군집과 명확한 경계가 나타났다.
  • CLML는 잘못된 음성 샘플과 진정한 양성 클러스터 간의 거리를 줄여, 라벨 누락의 영향을 완화할 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.