Skip to main content
QUICK REVIEW

[논문 리뷰] Learning with Non-Convex Truncated Losses by SGD

Yi Xu, Shenghuo Zhu|arXiv (Cornell University)|2018. 05. 21.
Statistical Methods and Inference참고 문헌 32인용 수 7
한 줄 요약

이 논문은 무거운 尾 비용과 이상치가 있는 환경에서 강건한 학습을 위한 비볼록 절단 손실 프레임워크를 제안하며, 경험적 리스크를 최소화하기 위해 확률적 경사 하강법(SGD)을 사용한다. 근사 정류점에 대한 초과 리스크 한계와 통계적 오차 보장을 수립하여 얕은 학습 및 깊은 학습 환경에서 노이즈 분포에 대한 사전 지식이 필요 없이도 개선된 강건성을 입증한다.

ABSTRACT

Learning with a {\it convex loss} function has been a dominating paradigm for many years. It remains an interesting question how non-convex loss functions help improve the generalization of learning with broad applicability. In this paper, we study a family of objective functions formed by truncating traditional loss functions, which is applicable to both shallow learning and deep learning. Truncating loss functions has potential to be less vulnerable and more robust to large noise in observations that could be adversarial. More importantly, it is a generic technique without assuming the knowledge of noise distribution. To justify non-convex learning with truncated losses, we establish excess risk bounds of empirical risk minimization based on truncated losses for heavy-tailed output, and statistical error of an approximate stationary point found by stochastic gradient descent (SGD) method. Our experiments for shallow and deep learning for regression with outliers, corrupted data and heavy-tailed noise further justify the proposed method.

연구 동기 및 목표

  • 기계 학습에서 중량 있는 꼬리 노이즈와 이상치 존재 시 볼록 손실 함수의 한계를 해결하기 위해.
  • 노이즈 특성에 대한 사전 지식이 필요 없는 일반적이고 분포에 종속되지 않는 강건한 학습 방법을 개발하기 위해.
  • 얕은 학습 및 깊은 학습 모두에서 경험적 리스크 최소화(ERM)에 비볼록 절단 손실을 사용하는 것의 이론적 근거를 제공하기 위해.
  • 절단 손실 하에서 SGD가 근사 정류점을 찾는 통계적 성능을 분석하기 위해.
  • 손상된 데이터와 중량 있는 꼬리 노이즈가 존재하는 회귀 작업에서 제안된 방법을 실증적으로 검증하기 위해.

제안 방법

  • 논문은 비볼록 절단 손실 함수의 가족을 도입하며, 이는 ℓ(h(xi), yi))로 정의되며, 여기서 ℓ는 표준 손실이고 φ는 큰 값을 절단하여 이상치에 대한 민감도를 감소시킨다.
  • 학습 데이터의 평균 절단 손실을 최소화하기 위해 절단 손실 함수를 사용하는 경험적 리스크 최소화(ERM) 문제를 설정한다.
  • 중량 있는 꼬리 출력 분포 하에서 절단 손실을 사용한 ERM에 대한 초과 리스크 한계를 이론적으로 수립한다.
  • 절단 손실 프레임워크 하에서 SGD가 찾은 근사 정류점에 대한 통계적 오차 한계를 유도한다.
  • 이 방법은 얕은 학습 및 깊은 학습 모델 모두에 적용되며, 지수 또는 중량 있는 꼬리 행동을 제외한 노이즈 분포에 대한 가정이 없다.
  • 이 접근법은 일반적이며 노이즈 분포에 대한 사전 지식이 필요 없어 실제 데이터의 이상치가 존재하는 경우에 널리 적용 가능하다.

실험 결과

연구 질문

  • RQ1비볼록 절단 손실 함수는 중량 있는 꼬리 노이즈와 이상치 존재 시 일반화 성능을 향상시킬 수 있는가?
  • RQ2SGD를 사용할 때 절단 손실을 적용했을 경우 초과 리스크와 통계적 오차에 대해 어떤 이론적 보장을 제공할 수 있는가?
  • RQ3데이터 손상과 중량 있는 꼬리 분포 하에서 절단 손실 기반 학습의 성능은 기존의 볼록 손실 방법보다 어떻게 비교되는가?
  • RQ4제안된 방법은 노이즈 분포 가정 없이도 얕은 학습 및 깊은 학습 모델 모두에서 강건하고 효과적인가?
  • RQ5SGD는 비볼록 절단 손실 함수 하에서 신뢰할 수 있는 해에 수렴할 수 있으며, 수렴 성질은 어떠한가?

주요 결과

  • 논문은 중량 있는 꼬리 출력 분포 하에서 절단 손실을 사용한 경험적 리스크 최소화에 대해 초과 리스크 한계를 수립하여 이상치에 대한 강건성을 향상시킴을 보여준다.
  • SGD가 찾은 근사 정류점에 대한 통계적 오차 한계가 도출되었으며, 이는 근사 최적 해로의 이론적 수렴을 입증한다.
  • 손상된 데이터와 중량 있는 꼬리 노이즈가 존재하는 회귀 작업에서 표준 볼록 손실 함수보다 제안된 방법이 더 뛰어난 성능을 보였다.
  • 얕은 학습 및 깊은 학습 모델에 대한 실험을 통해 이상치 또는 손상된 관측치 존재 하에서도 절단 손실의 강건성이 확인되었다.
  • 노이즈 분포에 대한 사전 지식이 필요 없어 실제 데이터에서 알려지지 않은 또는 중량 있는 꼬리 노이즈가 존재하는 경우에 일반적이고 실용적인 해결책이 된다.
  • 이론적 및 실증적 결과는 비볼록 절단 손실이 학습에서 표준 볼록 손실의 강건한 대안으로 효과적임을 함께 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.