Skip to main content
QUICK REVIEW

[논문 리뷰] How Does a Neural Network's Architecture Impact Its Robustness to Noisy Labels?

Jingling Li, Mozhi Zhang|arXiv (Cornell University)|2020. 12. 23.
Machine Learning and Data Classification참고 문헌 92인용 수 6
한 줄 요약

이 논문은 신경망 아키텍처가 노이즈가 있는 레이블에 대한 강건성에 미치는 영향을 분석하기 위해 학습된 표현의 예측 능력을 통해 강건성을 측정하는 프레임워크를 제안한다. 연구 결과, 목표 함수와 잘 일치하는 네트워크는 높은 테스트 오차를 기록하더라도 노이즈가 있는 환경에서도 강력한 예측 표현을 유지하며, 특히 클래스 또는 인스턴스 종속성 노이즈 상황에서 최신 기술(SOTA) 방법들을 능가함을 발견했다. 이러한 일치가 존재할 경우에만 성능 향상이 가능하다.

ABSTRACT

Noisy labels are inevitable in large real-world datasets. In this work, we explore an area understudied by previous works -- how the network's architecture impacts its robustness to noisy labels. We provide a formal framework connecting the robustness of a network to the alignments between its architecture and target/noise functions. Our framework measures a network's robustness via the predictive power in its representations -- the test performance of a linear model trained on the learned representations using a small set of clean labels. We hypothesize that a network is more robust to noisy labels if its architecture is more aligned with the target function than the noise. To support our hypothesis, we provide both theoretical and empirical evidence across various neural network architectures and different domains. We also find that when the network is well-aligned with the target function, its predictive power in representations could improve upon state-of-the-art (SOTA) noisy-label-training methods in terms of test accuracy and even outperform sophisticated methods that use clean labels.

연구 동기 및 목표

  • 딥 러닝 분야에서 다루지 않은 분야인 신경망 아키텍처가 노이즈가 있는 레이블에 대한 강건성에 미치는 영향을 조사하기 위해.
  • 학습된 표현에 대한 예측 능력 지표를 사용하여 아키텍처 일치성과 강건성 간의 관계를 수식적으로 정의하기 위해.
  • 목표 함수와의 더 나은 일치성이 노이즈가 있는 레이블 환경에서 우수한 성능을 낼 수 있음을 경험적으로 검증하기 위해.
  • 청결한 레이블에 접근할 수 없더라도 잘 일치하는 아키텍처는 최신 기술(SOTA) 노이즈 레이블 학습 방법을 능가할 수 있음을 보여주기 위해.
  • 실제 노이즈가 있는 데이터셋에서 청결한 레이블에 의존하는 방법보다 표현의 예측 능력이 성능을 초월할 수 있음을 보여주기 위해.

제안 방법

  • 소량의 청결한 레이블을 사용해 표현에 대해 선형 모델을 학습한 후의 테스트 정확도를 측정하여 예측 능력으로서의 강건성을 측정한다.
  • 신경망의 강건성과 아키텍처 및 목표/노이즈 함수 간의 일치성 간의 관계를 수식적으로 연결하는 프레임워크를 제안하며, 이는 [55]에서 유도된 것이다.
  • 분해 가능한 함수를 가진 단순화된 이론적 설정을 사용한다: f(x) = fr(h(x)) 및 g(x) = gr(h(x)), 여기서 fr은 선형이며 h는 학습 가능한 함수이다.
  • 순차적 학습을 적용하여 h와 일치하는 하위 구조가 노이즈가 있는 레이블 조건에서도 낮은 예측 오차를 유지할 수 있음을 보여준다.
  • 합성 그래프 작업(GNN 변종)과 다양한 노이즈 유형이 있는 이미지 데이터셋(예: Clothing1M)에서 경험적으로 평가한다.
  • 랜덤 노이즈와 실제적인(클래스 또는 인스턴스 종속성) 노이즈 조건에서 아키텍처 및 노이즈 레이블 방법 간의 성능을 비교한다.

실험 결과

연구 질문

  • RQ1목표 함수와의 아키텍처 일치성이 네트워크의 노이즈 레이블에 대한 강건성에 어떤 영향을 미치는가?
  • RQ2표현이 예측 가능할 경우, 높은 테스트 오차를 기록하는 네트워크도 레이블 노이즈에 강건한가?
  • RQ3다양한 아키텍처와 노이즈 유형에서 표현의 예측 능력과 강건성 간의 상관관계는 어떻게 되는가?
  • RQ4잘 일치하는 아키텍처는 특히 현실적인 노이즈 조건에서 최신 기술(SOTA) 노이즈 레이블 학습 방법을 능가할 수 있는가?
  • RQ5DivideMix와 같은 최신 기술(SOTA) 방법의 성능은 네트워크의 목표 함수와의 일치성에 따라 어떻게 달라지는가?

주요 결과

  • 목표 함수와 잘 일치하는 네트워크는 테스트 정확도가 낮더라도 표현의 예측 능력이 높게 유지되어 노이즈 레이블에 강건함을 보여준다.
  • 합성 그래프 작업에서 알고리즘 함수와 일치하는 GNN 변종은 일치하지 않는 대비군보다 노이즈가 있는 조건에서 훨씬 높은 예측 능력을 보였다.
  • 실제 세계의 레이블 노이즈가 있는 Clothing1M 데이터셋에서 잘 일치하는 네트워크는 청결한 레이블을 사용한 정교한 방법들보다 성능이 뛰어나 아키텍처 일치의 실용적 영향을 입증했다.
  • 목표 함수와 일치성이 떨어지는 네트워크의 경우, 최신 기술(SOTA) 방법인 DivideMix가 거의 개선 효과를 내지 못했고, 때로는 성능이 악화되기도 했다.
  • 잘 일치하는 네트워크는 특히 기존 방법이 어려움을 겪는 클래스 종속성 또는 인스턴스 종속성 노이즈 조건에서 최신 기술(SOTA) 방법의 성능을 향상시켰다.
  • 이론적 분석 결과, 순차적 학습 조건에서 h와 일치하는 하위 구조의 표현은 노이즈 데이터로 학습된 후에도 낮은 예측 오차(P ≤ ε)를 유지할 확률이 높음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.