Skip to main content
QUICK REVIEW

[논문 리뷰] No Regret Sample Selection with Noisy Labels

Song, H., Nariaki Mitsuo|arXiv (Cornell University)|2020. 03. 06.
Machine Learning and Data Classification참고 문헌 39인용 수 4
한 줄 요약

이 논문은 노이즈 있는 레이블을 가진 데이터셋에서 학습할 때 전체 선택 위험을 억제하기 위해 적응형 k세트 선택을 사용하는 새로운 딥러닝 방법인 TA kS를 제안한다. 이 방법은 상당히 낮은 계산 비용으로 최신 기술 수준의 정확도를 달성한다. 이론적으로는 회귀를 경계하고, 펌업을 기반으로 한 선택 전략을 활용함으로써, 단일 DNN을 학습하는 동안 청소된 샘플을 동적으로 선택한다. 여러 노이즈 있는 데이터셋에서 정확도와 효율성 면에서 공동 학습(co-training) 및 기타 기준 방법들을 능가한다.

ABSTRACT

Deep neural networks (DNNs) suffer from noisy-labeled data because of the risk of overfitting. To avoid the risk, in this paper, we propose a novel DNN training method with sample selection based on adaptive k-set selection, which selects k (< n) clean sample candidates from the whole n noisy training samples at each epoch. It has a strong advantage of guaranteeing the performance of the selection theoretically. Roughly speaking, a regret, which is defined by the difference between the actual selection and the best selection, of the proposed method is theoretically bounded, even though the best selection is unknown until the end of all epochs. The experimental results on multiple noisy-labeled datasets demonstrate that our sample selection strategy works effectively in the DNN training; in fact, the proposed method achieved the best or the second-best performance among state-of-the-art methods, while requiring a significantly lower computational cost. The code is available at https://github.com/songheony/TAkS.

연구 동기 및 목표

  • 노이즈 있는 레이블을 가진 데이터셋에서 딥 네URAL 네트워크를 학습하는 데 도전하는 것. 이는 과적합과 성능 저하를 초래할 수 있다.
  • 학습 중에 잘못 레이블링된 샘플을 효과적으로 식별하고 제외할 수 있는 샘플 선택 방법을 개발하는 것.
  • 최적의 선택이 사전에 알려지지 않았을 경우에도, 이론적으로 근거가 있는 접근 방식을 제공하고, 회귀가 경계되어야 한다.
  • 기존의 공동 학습(co-training) 및 완전한 k세트 방법과 비교해 계산 비용을 낮추면서도 높은 성능을 달성하는 것.
  • 온라인 및 불확실한 학습 환경에서, Follow-the-Perturbed-Leader(FPL)을 통한 적응형 k세트 선택의 효과를 입증하는 것.

제안 방법

  • 이 방법은 각 학습 에포크에서 노이즈 위험 벡터 θt를 모델 예측에서 추정함으로써, 최소한의 노이즈 위험을 가진 k개의 샘플을 선택하기 위해 적응형 k세트 선택을 사용한다.
  • 선택 문제를 T개의 에포크 동안의 총 선택 위험 ∑ₜ dₜ·θₜ 최소화로 공식화한다. 여기서 dₜ는 에포크 t에서의 k-핫 선택 벡터이다.
  • FPL 알고리즘은 노이즈 위험 벡터에 무작위 펌복을 도입함으로써, θₜ가 신뢰할 수 없을 경우에도 이론적 회귀 경계를 가진 온라인 선택을 가능하게 한다.
  • 이 방법은 각 에포크마다 선택된 k개의 샘플로 단일 DNN을 학습함으로써, 다수의 네트워크를 사용하는 공동 학습의 계산 오버헤드를 피한다.
  • 노이즈 위험 θi,t는 샘플 i가 잘못 레이블링되었을 가능성으로 계산되며, 학습 중에 반복적으로 갱신된다.
  • 이 방법은 계산 효율성이 뛰어나며, 각 에포크당 O(n)의 시간 복잡도를 가지므로 대규모 데이터셋에 대한 확장성이 뛰어나다.

실험 결과

연구 질문

  • RQ1노이즈 있는 레이블을 가진 데이터셋에서, 회귀 최소화를 통한 적응형 k세트 선택이 기존의 샘플 선택 방법보다 DNN 학습 성능을 향상시킬 수 있는가?
  • RQ2노이즈 위험 추정이 온라인적이고 불확실한 환경이지만, FPL 기반 선택 전략이 유한한 회귀를 달성할 수 있는가?
  • RQ3동적으로 선택된 k개의 샘플로 학습된 단일 DNN이, 결합된 네트워크를 사용하는 공동 학습 방법보다 성능이 뛰어나게 될 수 있는가?
  • RQ4특히 대칭 노이즈 비율이 80%인 극단적인 경우를 포함해, 다양한 수준의 레이블 노이즈 하에서 이 방법의 성능은 어떠한가?
  • RQ5노이즈 위험 벡터가 학습 중에 잘못 레이블링된 샘플을 효과적으로 식별하고 제외하는 데 얼마나 성공적인가?

주요 결과

  • TA kS는 다양한 노이즈 설정 하에서 MNIST, CIFAR-10, CIFAR-100, Clothing1M 등 모든 벤치마크 데이터셋에서 최고 또는 두 번째로 높은 테스트 정확도를 기록했다.
  • 대칭 80% 노이즈가 있는 CIFAR-10에서 TA kS는 70.22%의 테스트 정확도를 달성했으며, 분석 실험에서 Greedy(70.22%)와 Naive(66.06%)를 크게 앞서는 성능을 보였다.
  • 높은 노이즈 조건에서도 학습 전반에 걸쳐 레이블 정밀도를 유지하거나 향상시켰으며, 이는 강력한 노이즈 내성과 안정적인 학습 능력을 시사한다.
  • 특징 시각화 결과, 청소된 샘플은 조밀한 클러스터를 형성한 반면, 잘못 레이블링된 샘플은 산만하게 흩어져 있었고, 대부분 선택 메커니즘에 의해 제외되었다.
  • 표준 학습 및 공동 학습 기준보다 빠르며, 대칭 80% 노이즈 조건에서는 각 에포크당 n개 이하의 샘플만 사용하기 때문에 최대 4배 빠르게 작동했다.
  • 분석 실험을 통해 FPL의 펌복 메커니즘이 필수적임을 확인했으며, Greedy와 Naive는 높은 노이즈 조건에서 위험 추정의 불안정성으로 인해 실패했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.