Skip to main content
QUICK REVIEW

[논문 리뷰] Class-Distribution-Aware Pseudo Labeling for Semi-Supervised Multi-Label Learning

Mingkun Xie, Jia‐Hao Xiao|arXiv (Cornell University)|2023. 05. 04.
Text and Document Classification Technologies인용 수 4
한 줄 요약

이 논문은 클래스 분포 인식 임계치를 사용하여 클래스 인식 방식으로 의사 레이블을 할당하는 새로운 방법인 Class-Aware Pseudo-Labeling (CAP)을 제안한다. 레이블이 부여된 데이터로부터 진정한 클래스 분포를 추정하고 정규화된 학습을 통해 일치를 강제함으로써, CAP는 의사 레이블링 정확도를 크게 향상시키고, 특히 레이블이 제한된 경우 기준 데이터셋에서 최고 성능을 달성한다.

ABSTRACT

Pseudo-labeling has emerged as a popular and effective approach for utilizing unlabeled data. However, in the context of semi-supervised multi-label learning (SSMLL), conventional pseudo-labeling methods encounter difficulties when dealing with instances associated with multiple labels and an unknown label count. These limitations often result in the introduction of false positive labels or the neglect of true positive ones. To overcome these challenges, this paper proposes a novel solution called Class-Aware Pseudo-Labeling (CAP) that performs pseudo-labeling in a class-aware manner. The proposed approach introduces a regularized learning framework incorporating class-aware thresholds, which effectively control the assignment of positive and negative pseudo-labels for each class. Notably, even with a small proportion of labeled examples, our observations demonstrate that the estimated class distribution serves as a reliable approximation. Motivated by this finding, we develop a class-distribution-aware thresholding strategy to ensure the alignment of pseudo-label distribution with the true distribution. The correctness of the estimated class distribution is theoretically verified, and a generalization error bound is provided for our proposed method. Extensive experiments on multiple benchmark datasets confirm the efficacy of CAP in addressing the challenges of SSMLL problems.

연구 동기 및 목표

  • 기존의 인스턴스 인식 방법이 알려지지 않은 레이블 수와 클래스 불균형 문제로 인해 레이블링의 신뢰성이 떨어지는 반감성 다중 레이블 학습(SSMLL)의 과제를 해결한다.
  • 누락된 레이블에 대한 가정이나 고정된 임계치를 전제로 하는 기존 방법의 한계를 극복한다.
  • 진정한 클래스 분포를 추정하고 이를 바탕으로 의사 레이블 분포를 일치시킴으로써 비레이블 데이터를 효과적으로 활용할 수 있는 방법을 개발한다.
  • 클래스 인식 임계치를 사용하는 정규화된 학습 프레임워크를 통해 소수의 레이블 예제가 존재하는 경우에도 견고한 성능을 확보한다.

제안 방법

  • 추정된 클래스 분포에 기반한 임계치를 활용해 각 클래스별로 양성 및 음성 의사 레이블을 할당하는 클래스 인식 의사 레이블링 전략을 제안한다.
  • 클래스 인식 임계치에 기반해 각 클래스의 양성 및 음성 의사 레이블 수를 제어하는 정규화된 학습 프레임워크를 도입한다.
  • 제안된 관찰에 따라 이론적으로 타당한 근거를 갖춘 진정한 클래스 분포를 레이블이 부여된 데이터로부터 추정한다.
  • 진정한 기반 클래스 분포와 의사 레이블 분포를 일치시키기 위해 클래스 분포 인식 임계치 전략을 구현한다.
  • 이론적 분석을 통해 추정된 클래스 분포의 정확성을 입증하고, CAP의 일반화 오차 경계를 제공한다.
  • 두 단계 학습 프로세스를 구현한다: 먼저 레이블이 부여된 데이터로부터 클래스 분포를 추정하고, 그 다음 임계치를 적용해 비레이블 데이터의 의사 레이블을 생성한다.

실험 결과

연구 질문

  • RQ1인스턴스 인식 방법과 비교해 클래스 인식 의사 레이블링 전략이 반감성 다중 레이블 학습에서 성능 향상에 기여하는가?
  • RQ2소수의 레이블 데이터로부터 다중 레이블 환경에서 진정한 클래스 분포를 얼마나 정확하게 추정할 수 있는가?
  • RQ3의사 레이블 분포를 진정한 클래스 분포와 일치시키는 것이 더 나은 일반화 및 더 낮은 오진/누락을 이끌어내는가?
  • RQ4η₁과 η₀로 제어되는 신뢰 구간을 사용할 경우, 레이블 불균형 상황에서 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • CAP는 모든 기준 데이터셋(VOC, COCO, NUS)에서 최고 성능을 기록하며, 특히 레이블 데이터가 부족한 경우 기존 방법들을 크게 앞서며 최고 성능(SOTA)을 달성한다.
  • VOC 및 COCO에서 CAP는 가장 높은 mAP 스코어를 기록했으며, 저레이블 환경(p=0.05)에서 다음으로 좋은 베이스라인 대비 최대 5.2% 향상된 성능을 보였다.
  • 심지어 광범위한 초모델 튜닝과 아키텍처 수정을 거친 후에도, 인스턴스 인식 의사 레이블링 베이스라인 및 두 가지 강력한 SSL 방법보다 뛰어난 성능을 보였다.
  • 첫 번째 학습 에포크에서, 동일한 모델 예측을 바탕으로 다른 방법들보다 CF1 스코어에서 앞서며, 클래스 비율을 추정하는 데서 뛰어난 능력을 입증했다.
  • 신뢰할 수 없는 양성 의사 레이블을 제거하는 것(η₁ < 1)은 성능 향상을 가져왔고, 반면 음성 의사 레이블을 제거하면 다중 레이블 데이터의 본질적 양성-음성 불균형으로 인해 성능이 악화되었다.
  • 이론적 분석을 통해 추정된 클래스 분포의 정확성을 확인했으며, 의사 레이블링 품질에 따라 달라지는 일반화 오차 경계를 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.