Skip to main content
QUICK REVIEW

[논문 리뷰] Choosing the Sample with Lowest Loss makes SGD Robust

Vatsal Shah, Xiaoxia Wu|arXiv (Cornell University)|2020. 01. 10.
Statistical Methods and Inference참고 문헌 35인용 수 11
한 줄 요약

이 논문은 각 반복에서 무작위로 선택된 k개의 샘플 중 손실이 가장 낮은 샘플을 선택하는 강건한 확률적 경사하강법의 변종인 Min-k 손실 SGD(MKL-SGD)를 제안한다. 저손실 샘플에 초점을 맞추어 MKL-SGD는 볼록 기계학습 문제에서 이상치에 대해 향상된 강건성을 달성하며, 이론적 보장에 의해 악성 국소 최소값을 피하고 이상치 조건 하에서 표준 SGD보다 더 나은 해로 수렴함을 보여준다. 특히 k가 충분히 클 경우에 두드러진다.

ABSTRACT

The presence of outliers can potentially significantly skew the parameters of machine learning models trained via stochastic gradient descent (SGD). In this paper we propose a simple variant of the simple SGD method: in each step, first choose a set of k samples, then from these choose the one with the smallest current loss, and do an SGD-like update with this chosen sample. Vanilla SGD corresponds to k = 1, i.e. no choice; k >= 2 represents a new algorithm that is however effectively minimizing a non-convex surrogate loss. Our main contribution is a theoretical analysis of the robustness properties of this idea for ML problems which are sums of convex losses; these are backed up with linear regression and small-scale neural network experiments

연구 동기 및 목표

  • 기계학습 데이터셋에서 표준 SGD가 이상치에 민감하여 모델 파라미터가 심각하게 왜곡되는 문제를 해결하기 위해.
  • 주요 아키텍처나 알고리즘 변경 없이도 간단하고 즉시 적용 가능한 표준 SGD의 강건성 향상 기법을 개발하기 위해.
  • 노이즈가 없는 경우와 있는 경우, 이상치가 있는 경우와 없는 경우를 포함한 다양한 설정 하에서 제안된 방법의 강건성 특성을 이론적으로 분석하기 위해.
  • 라벨 손실 조건 하에서 선형 회귀 및 딥러닝 작업(MNIST, CIFAR-10)에서 방법을 실증적으로 검증하기 위해.
  • k개의 샘플 중 손실이 가장 낮은 샘플을 선택하는 것이 표준 SGD보다 더 나은 수렴과 강건성을 달성하는가를 보여주기 위해.

제안 방법

  • 각 SGD 반복에서 훈련 데이터에서 무작위로 k개의 샘플을 선택한다.
  • 이 집합에서 현재 손실이 가장 작은 샘플을 선택하여 기울기 업데이트에 사용한다.
  • 업데이트 규칙은 표준 SGD와 동일하다: w_{t+1} = w_t - η∇f_i(w_t), 여기서 i는 집합 내 손실이 가장 낮은 샘플의 인덱스이다.
  • 이론적으로는 이상치가 없을 경우에도 비볼록 대체 손실 함수를 최소화하는 것으로 분석된다.
  • 실용적 변종은 k개의 샘플을 평가하고 αk 크기의 배치를 선택하여 효율성을 향상시키면서도 강건성을 유지한다.
  • 이론적 분석은 강력한 볼록 손실을 대상으로 하며, 노이즈가 없는 경우와 있는 경우, 이상치가 있는 경우와 없는 경우의 수렴 속도를 유도한다.

실험 결과

연구 질문

  • RQ1k개 샘플 중 손실이 가장 낮은 샘플을 선택하는 것이 SGD의 이상치에 대한 강건성에 기여하는가?
  • RQ2다양한 데이터 조건 하에서 MKL-SGD의 수렴 및 국소 최소값에 대한 이론적 행동은 어떠한가?
  • RQ3이상치 존재 조건에서 k의 선택이 수렴 속도와 강건성 사이의 트레이드오프에 어떻게 영향을 주는가?
  • RQ4선형 회귀 및 딥러닝 환경에서 MKL-SGD는 표준 SGD와 median loss SGD와 같은 다른 강건 기반 방법보다 뛰어나게 성능을 발휘하는가?
  • RQ5비볼록 대체 손실이더라도 MKL-SGD는 악성 국소 최소값을 피할 수 있는가?

주요 결과

  • 이상치가 존재할 경우, 특히 k가 높은 손실 샘플의 영향을 줄일 수 있을 정도로 충분히 클 경우, MKL-SGD는 표준 SGD보다 진짜 최적값에 더 잘 수렴한다.
  • 이상치가 있는 노이즈 없는 설정에서, 진짜 최적값 w*에 가장 가까운 국소 최소값은 k가 조건수에 따라 정해지는 임계값을 초과할 경우 MKL-SGD 하에서 표준 SGD의 고정점보다 더 우수하다.
  • 선형 회귀에서 MKL-SGD는 SGD와 median loss SGD를 모두 능가하며, 강건성(높은 k)과 수렴 속도 사이에 명확한 트레이드오프가 존재한다.
  • 2층 CNN과 라벨 노이즈 조건 하에서 MNIST에서 MKL-SGD는 α=0.9와 k=10을 사용해 directed noise(ε=0.1) 조건에서 97.23%의 정확도를 달성했으며, SGD(96.76%)를 능가하고 오라클 성능(98.52%)에 가까워졌다.
  • ResNet-18와 directed noise 조건 하에서 CIFAR-10에서 MKL-SGD는 α=0.7과 k=16을 사용해 ε=0.1일 때 81.00%의 정확도를 기록했으며, SGD(79.1%)를 능가하고 오라클 성능(84.56%)에 가까워졌다.
  • 이론적 분석은 이상치가 없을 경우 비록 비볼록 대체 손실을 최소화하더라도 MKL-SGD가 악성 국소 최소값을 피함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.