Skip to main content
QUICK REVIEW

[논문 리뷰] Approximating Instance-Dependent Noise via Instance-Confidence Embedding

Yivan Zhang, Masashi Sugiyama|arXiv (Cornell University)|2021. 03. 25.
Machine Learning and Data Classification참고 문헌 73인용 수 6
한 줄 요약

이 논문은 다중분류에서 인스턴스에 의존하는 노이즈(IDN)를 근사하기 위해, 각 인스턴스당 학습 가능한 스칼라 신뢰도(confidence)를 통해 레이블 손상 모델링을 수행하는 Instance-Confidence Embedding(ICE)을 제안한다. ICE는 인스턴스별 임베딩을 사용해 비스무스스러운 노이즈 패턴을 포착하여, 이미지 및 텍스트 작업 전반에서 강건성과 모호하거나 잘못 레이블링된 인스턴스 탐지 능력을 향상시킨다.

ABSTRACT

Label noise in multiclass classification is a major obstacle to the deployment of learning systems. However, unlike the widely used class-conditional noise (CCN) assumption that the noisy label is independent of the input feature given the true label, label noise in real-world datasets can be aleatory and heavily dependent on individual instances. In this work, we investigate the instance-dependent noise (IDN) model and propose an efficient approximation of IDN to capture the instance-specific label corruption. Concretely, noting the fact that most columns of the IDN transition matrix have only limited influence on the class-posterior estimation, we propose a variational approximation that uses a single-scalar confidence parameter. To cope with the situation where the mapping from the instance to its confidence value could vary significantly for two adjacent instances, we suggest using instance embedding that assigns a trainable parameter to each instance. The resulting instance-confidence embedding (ICE) method not only performs well under label noise but also can effectively detect ambiguous or mislabeled instances. We validate its utility on various image and text classification tasks.

연구 동기 및 목표

  • 실제 데이터셋에서 인스턴스별 레이블 손상 패턴을 포착하지 못하는 클래스 조건부 노이즈(CCN) 가정의 한계를 해결하기 위해.
  • 각 인스턴스 전이 행렬의 높은 복잡도를 피하면서도, 인스턴스에 의존하는 노이즈(IDN)에 대한 실용적이고 도메인에 관계없는 근사 방법을 개발하기 위해.
  • 인스턴스별 신뢰도 점수를 학습하여 모호하거나 잘못 레이블링된 인스턴스를 효과적으로 탐지할 수 있도록 하기 위해.
  • 다중분류에서 레이블 손상 과정을 명시적으로 모델링하기 위한 모델 독립적이고 데이터 효율적인 접근법을 제공하기 위해.

제안 방법

  • 각 인스턴스당 단일 스칼라 신뢰도 파rameter를 사용해 IDN 모델의 변동형 근사를 제안하여, 전체 K×K 전이 행렬 추정의 복잡도를 감소시킴.
  • 인스턴스-신뢰도 임베딩(ICE)을 도입하여 각 훈련 인스턴스에 대해 학습 가능한 신뢰도 파rameter를 할당함으로써 비스무스스러운, 인스턴스별 특화된 노이즈 패턴을 모델링.
  • 클래스 후행 확률을 예측하는 미분 가능한 신경망을 사용하면서도, 훈련 중에 동시에 신뢰도 파rameter를 최적화함.
  • 노이즈가 있는 클래스 후행 확률을, 인스턴스별 신뢰도 값에 의해 결정되는 가중치 평균으로 설정.
  • 교차 엔트로피 손실을 사용해 모델을 엔드 투 엔드로 훈련하고, 신뢰도 파rameter는 역전파를 통해 업데이트함.
  • 학습된 신뢰도 점수를 활용해 추론 중에 모호하거나 잘못 레이블링된 인스턴스를 식별하고 표시함.

실험 결과

연구 질문

  • RQ1각 인스턴스당 스칼라 신뢰도 파rameter가 복잡한 인스턴스에 의존하는 노이즈 패턴을 효과적으로 근사할 수 있는가?
  • RQ2기존의 CCN 기반 접근법에 비해 ICE 방법이 인스턴스에 의존하는 노이즈 하에서 모델 일반화 성능을 향상시키는가?
  • RQ3학습된 신뢰도 점수가 실세계 데이터셋에서 모호하거나 잘못 레이블링된 인스턴스를 신뢰성 있게 탐지할 수 있는가?
  • RQ4다양한 수준의 레이블 노이즈 하에서 다양한 이미지 및 텍스트 분류 벤치마크에서 ICE의 성능은 어떠한가?
  • RQ5도메인 특화 지식이나 노이즈 구조에 대한 사전 가정 없이도 ICE 방법이 강건하고 효과적인가?

주요 결과

  • ICE는 인스턴스에 의존하는 노이즈 하에서 이미지 및 텍스트 분류 벤치마크에서 최신 기준 성능을 달성하며, CCN 기반 베이스라인을 능가함.
  • 학습된 신뢰도 점수를 통해 잘못 레이블링되거나 모호한 인스턴스를 효과적으로 탐지하며, 낮은 신뢰도와 레이블 오류 간에 높은 상관관계를 보임.
  • 실험 결과, ICE는 과적합을 감소시키고 일반화 성능을 향상시키며, 특히 고노이즈 환경에서 두드러진 성능 향상을 보임.
  • 스칼라 신뢰도 근사는 전체 전이 행렬 추정에 비해 훨씬 낮은 계산 비용으로 IDN의 핵심 요소를 효과적으로 포착함.
  • CIFAR-10, CIFAR-100 및 QNLI, RTE와 같은 여러 NLP 벤치마크를 포함한 다양한 데이터셋에서 ICE는 강력한 강건성을 보임.
  • ICE가 학습한 신뢰도 점수는 레이블 품질과 강하게 상관관계를 보이며, 외부 감독 없이도 효과적인 데이터 정제가 가능함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.