Skip to main content
QUICK REVIEW

[논문 리뷰] Tripartite: Tackle Noisy Labels by a More Precise Partition

Xuefeng Liang, Longshan Yao|arXiv (Cornell University)|2022. 02. 19.
Machine Learning and Data Classification인용 수 10
한 줄 요약

Tripartite는 이중 네트워크 불일치와 레이블 예측 불일치를 이용해 훈련 데이터를 하드, 노이지, 클린 세 부분으로 분할하는 새로운 방법을 제안한다. 이는 하드 샘플에 대해 저중량 학습과 노이지 데이터에 대해 자기지도 학습을 가능하게 하여, 실세계 노이지 데이터에서 특히 뛰어난 성능을 달성한다. 다섯 개인 벤치마크 데이터셋에서 최신 기준 성능을 기록한다.

ABSTRACT

Samples in large-scale datasets may be mislabeled due to various reasons, and Deep Neural Networks can easily over-fit to the noisy label data. To tackle this problem, the key point is to alleviate the harm of these noisy labels. Many existing methods try to divide training data into clean and noisy subsets in terms of loss values, and then process the noisy label data varied. One of the reasons hindering a better performance is the hard samples. As hard samples always have relatively large losses whether their labels are clean or noisy, these methods could not divide them precisely. Instead, we propose a Tripartite solution to partition training data more precisely into three subsets: hard, noisy, and clean. The partition criteria are based on the inconsistent predictions of two networks, and the inconsistency between the prediction of a network and the given label. To minimize the harm of noisy labels but maximize the value of noisy label data, we apply a low-weight learning on hard data and a self-supervised learning on noisy label data without using the given labels. Extensive experiments demonstrate that Tripartite can filter out noisy label data more precisely, and outperforms most state-of-the-art methods on five benchmark datasets, especially on real-world datasets.

연구 동기 및 목표

  • 손실 값만으로는 하드 샘플과 노이지 또는 클린 샘플을 구분하지 못하는 기존 샘플 선택 방법의 한계를 해결하기 위해.
  • 특성 간 유사성으로 인해 잘못 분류되기 쉬운 하드 샘플을 명시적으로 식별함으로써 클린 및 노이지 데이터 세트의 품질을 향상시키기 위해.
  • 노이지 레이블로 인한 피해를 최소화하면서도 노이지 레이블 데이터의 유용성을 극대화하기 위해 맞춤형 학습 전략을 적용하기 위해.
  • 실세계 데이터셋에서 모호하고 유사한 카테고리의 잘못된 레이블이 존재할 경우, 노이지 레이블에 대한 과적합을 줄이기 위해 더 정밀한 데이터 분할 메커니즘을 제공하기 위해.

제안 방법

  • 두 네트워크 간 예측 불일치와 네트워크의 예측과 주어진 레이블 간 불일치를 기반으로 훈련 데이터를 하드, 노이지, 클린 세 부분으로 분할한다.
  • 두 네트워크 간 예측 불일치가 높은 샘플을 하드 샘플로 식별하며, 이는 레이블의 정확성과 무관하다.
  • 한 네트워크의 예측이 주어진 레이블과 강하게 다를 경우, 즉 두 네트워크의 예측이 일치하더라도 노이지 샘플로 간주한다.
  • 하드 샘플에 저중량 학습 전략을 적용하여 손실에 기여도를 줄여, 모호하거나 잘못 레이블링된 하드 샘플로 인한 피해를 최소화한다.
  • 주어진 레이블에 의존하지 않고 노이지 레이블 샘플에 대해 자기지도 학습을 적용하여 유용한 특징 정보를 유지한다.
  • 세 부분으로 나누어진 전략을 훈련 파이프라인에 통합하여 각 세트에 맞는 학습 전략을 선택적으로 적용함으로써 일반화 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1하드 샘플이 존재하는 상황에서 기존의 이원 분할(클린/노이지) 전략에 비해 삼원 분할(하드, 노이지, 클린) 전략이 더 우수한 성능을 낼 수 있는가?
  • RQ2손실 기반 기준에 비해 이중 네트워크 예측 불일치가 하드 및 노이지 샘플 식별 정확도를 어떻게 향상시키는가?
  • RQ3노이지 레이블 데이터에 대해 자기지도 학습을 적용할 경우, 노이지 레이블의 부정적 영향을 어느 정도 줄일 수 있으며, 유용한 정보는 어떻게 유지할 수 있는가?
  • RQ4하드 샘플에 저중량 학습을 적용할 경우, 실세계 데이터셋에서 모호하거나 잘못 레이블링된 예시에 대한 과적합을 줄일 수 있는가?
  • RQ5특히 대칭 노이즈와 높은 하드 샘플 비율을 가진 현실적인 노이즈에 대해 Tripartite 방법은 어느 정도 강건한가?

주요 결과

  • 모든 비교 방법 중에서 Tripartite는 클린 및 노이지 세트의 분할 정확도가 가장 높으며, 특히 현실적인 노이즈 설정에서 GMM 및 소규모 손실 기준에 비해 뛰어난 성능을 보였다.
  • 50%의 현실적 노이즈가 존재하는 CIFAR-10에서, Tripartite는 자기지도 학습 전략을 통해 68.62%의 정확도를 달성했으며, 동일한 설정에서 드롭 전략(65.04%)과 준지도 학습 전략(65.45%)을 크게 앞서는 성능을 보였다.
  • 하드 샘플에 대해 최적의 저중량 하이퍼파라미터 λh = 0.6을 설정할 경우 최고의 성능을 기록했으며, λh = 0.2일 경우 하드 클린 샘플로부터의 학습이 부족하여 성능이 열등했다.
  • 노이지 세트에 대해 자기지도 학습을 적용한 전략이 가장 뛰어난 결과를 내었으며, 50%의 현실적 노이즈에서 68.62%의 정확도를 기록하여 의사라벨 기반 준지도 학습 방법보다 뛰어난 성능을 보였다.
  • Tripartite의 분할 품질은 모델 성능과 직접적인 상관관계를 보였으며, Co-teaching 및 DivideMix에서 Tripartite로 분할된 세트를 사용할 경우 더 높은 정확도를 기록했다.
  • 실제 노이즈가 존재하는 SVHN 데이터셋에서 Tripartite는 노이지 데이터에 대해 자기지도 학습을 적용하여 78.76%의 정확도를 달성했으며, 드롭 및 준지도 기반 베이스라인을 모두 앞서는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.