Skip to main content
QUICK REVIEW

[논문 리뷰] There Are Many Consistent Explanations of Unlabeled Data: Why You Should Average

Ben Athiwaratkun, Marc Finzi|arXiv (Cornell University)|2018. 06. 14.
Machine Learning and Data Classification인용 수 149
한 줄 요약

본 논문은 일관성 기반의 준지도 학습을 분석하고, SGD가 많은 해(solution)를 탐색한다는 것을 보여준다; SWA와 fast-SWA를 통한 가중치 평균화가 일반화 성능을 향상시키며, 제한된 라벨에서도 CIFAR-10/100에서 최첨단 성능을 달성한다.

ABSTRACT

Presently the most successful approaches to semi-supervised learning are based on consistency regularization, whereby a model is trained to be robust to small perturbations of its inputs and parameters. To understand consistency regularization, we conceptually explore how loss geometry interacts with training procedures. The consistency loss dramatically improves generalization performance over supervised-only training; however, we show that SGD struggles to converge on the consistency loss and continues to make large steps that lead to changes in predictions on the test data. Motivated by these observations, we propose to train consistency-based methods with Stochastic Weight Averaging (SWA), a recent approach which averages weights along the trajectory of SGD with a modified learning rate schedule. We also propose fast-SWA, which further accelerates convergence by averaging multiple points within each cycle of a cyclical learning rate schedule. With weight averaging, we achieve the best known semi-supervised results on CIFAR-10 and CIFAR-100, over many different quantities of labeled training data. For example, we achieve 5.0% error on CIFAR-10 with only 4000 labels, compared to the previous best result in the literature of 6.3%.

연구 동기 및 목표

  • 손실 기하학과 학습 절차가 일관성 기반의 준지도 모델에 어떤 영향을 미치는지 이해한다.
  • 일관성 손실에 대해 SGD가 수렴하는 데 어려움을 겪는 이유와 가중치 평균화가 해를 안정화하는 방법을 조사한다.
  • 확률적 가중치 평균화(SWA)와 fast-SWA를 제안하고 일반화를 개선하는지 평가한다.
  • 제한된 라벨 데이터로 CIFAR-10/100에서 개선된 최첨단 결과를 보여준다.
  • 일관성 기반 방법에 가중치 평균화를 적용하기 위한 실용적인 지침을 제공한다.

제안 방법

  • 입력 Jacobian 및 Hessian 고유값에 대한 암묵적 정규화를 보여주기 위해 단순화된 Pi 모델을 분석한다.
  • Pi, Mean Teacher, 감독 학습 모델의 학습 궤적을 경험적으로 비교하여 더 큰 SGD 스텝과 다양한 해를 보인다.
  • SGD 반복 간 가중치(및 예측)를 평균화하는 것이 일반화를 향상시킴을 입증한다.
  • 순환 학습률과 사이클당 다중 포인트 평균화를 포함한 확률적 가중치 평균화(SWA) 및 fast-SWA를 도입한다.
  • CIFAR-10/100에서 라벨링/비라벨링 데이터의 변화에 따라 Pi와 Mean Teacher에 SWA/fast-SWA를 적용하고 개선을 보고한다.

실험 결과

연구 질문

  • RQ1일관성 손실이 손실 지형의 기하학과 모델 일반화에 어떤 영향을 미치는가?
  • RQ2일관성 기반 방법에서 SGD 궤적이 왜 다양한 상태를 유지하는가와 테스트 예측에 미치는 영향은 무엇인가?
  • RQ3SWA/fast-SWA가 단일-SGD 솔루션 및 표준 앙상블보다 준지도 모델에서 더 나은 성능을 발휘할 수 있는가?
  • RQ4제한된 라벨로 Pi 및 Mean Teacher 모델이 SWA/fast-SWA와 결합되었을 때 CIFAR-10/100에서 새로운 최첨단 성능을 달성하는가?
  • RQ5추가 비라벨 데이터(예: Tiny Images)가 SWA/fast-SWA의 성능에 어떤 영향을 미치는가?

주요 결과

  • 단순화된 Pi 모델은 입력-출력 자코비안의 노름과 Hessian 고유값을 암묵적으로 정규화하여 더 완만한( flatter) 해를 유도한다.
  • 일관성 기반 모델(Pi 및 MT)은 감독 학습 모델보다 더 큰 가중치 공간 궤적과 더 높은 예측 다양성을 보인다.
  • SGD 반복의 가중치 평균화(SWA) 또는 예측의 평균화가 일반화를 현저히 향상시키며, Pi/MT에서 감독 학습보다 더 큰 이득을 보인다.
  • SWA와 더 빠른 변형인 fast-SWA를 적용하면 수렴 속도가 크게 빨라지고 CIFAR-10/100에서 최상위 준지도 결과를 달성하며, 예를 들어 CIFAR-10에서 4k 라벨로 오류율 5.0%를 달성한다.
  • Fast-SWA는 SWA보다 더 빨리 수렴하고, 많은 설정에서 더 적은 사이클로 동등하거나 더 나은 성능을 달성한다.
  • Fast-SWA는 또한 관련 도메인 적응 작업(CIFAR-10에서 STL로)의 오류를 19.9%에서 16.8%로 개선한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.