Skip to main content
QUICK REVIEW

[논문 리뷰] Support Vector Machine Classifier via $L_{0/1}$ Soft-Margin Loss

Huajun Wang, Yuan‐Hai Shao|arXiv (Cornell University)|2019. 12. 16.
Sparse and Compressive Sensing Techniques참고 문헌 55인용 수 7
한 줄 요약

이 논문은 비볼록이고 이산적인 소프트 마진 손실을 사용하여 잘못 분류된 샘플 수와 서포트 벡터 수를 최소화하는 $L_{0/1}$-SVM 분류기 모델을 제안한다. P-정류점을 통한 최적성 이론을 수립하고, $L_{0/1}$ 서포트 벡터를 정의하며, 작업 세트 전략을 통합한 빠른 프록시멀 ADMM 알고리즘을 개발하여 특히 대규모 데이터셋에서 뛰어난 속도와 더 적은 서포트 벡터를 달성한다.

ABSTRACT

Support vector machine (SVM) has attracted great attentions for the last two decades due to its extensive applications, and thus numerous optimization models have been proposed. To distinguish all of them, in this paper, we introduce a new model equipped with an $L_{0/1}$ soft-margin loss (dubbed as $L_{0/1}$-SVM) which well captures the nature of the binary classification. Many of the existing convex/non-convex soft-margin losses can be viewed as a surrogate of the $L_{0/1}$ soft-margin loss. Despite the discrete nature of $L_{0/1}$, we manage to establish the existence of global minimizer of the new model as well as revealing the relationship among its minimizers and KKT/P-stationary points. These theoretical properties allow us to take advantage of the alternating direction method of multipliers. In addition, the $L_{0/1}$-support vector operator is introduced as a filter to prevent outliers from being support vectors during the training process. Hence, the method is expected to be relatively robust. Finally, numerical experiments demonstrate that our proposed method generates better performance in terms of much shorter computational time with much fewer number of support vectors when against with some other leading methods in areas of SVM. When the data size gets bigger, its advantage becomes more evident.

연구 동기 및 목표

  • 비볼록이고 비연속적인 소프트 마진 SVM 모델인 이론적으로 이상적이지만 NP-어려운 $L_{0/1}$-SVM에 대한 엄밀한 최적성 이론의 부재를 해결하기 위해.
  • 표준 이중 문제의 부재에도 불구하고 P-정류점과 연관된 $L_{0/1}$ 서포트 벡터를 정의함으로써 체계적인 작업 세트 전략을 가능하게 하기 위해.
  • 강한 경험적 성능을 보이는 비볼록 $L_{0/1}$-SVM 문제를 효율적이고 확장 가능한 알고리즘으로 해결하기 위해.
  • 특히 대규모 데이터에서 $L_{0/1}$-SVM이 최첨단 SVM 솔버보다 더 적은 서포트 벡터와 더 빠른 수렴 속도를 보임을 입증하기 위해.

제안 방법

  • P-정류점을 사용하여 $L_{0/1}$-SVM의 전역 최적해 존재성을 수립하고 최적성 조건을 유도한다.
  • 이중 문제의 비가역성으로 인해 명시적 도출이 불가능하더라도, 이중 문제에서 비영인 라그랑주 승수에 대응하는 $L_{0/1}$ 서포트 벡터를 정의한다.
  • 반복 계산 비용을 줄이고 수렴 속도를 향상시키기 위해 P-정류 조건에 기반한 작업 세트 전략을 제안한다.
  • 비볼록 $L_{0/1}$-SVM 문제를 해결하기 위해 작업 세트를 프록시멀 분할 역할 방법(ADMM)에 통합한다.
  • ADMM 프레임워크 내에서 비볼록이고 비연속적인 손실 함수를 처리하기 위해 $L_{0/1}$ 프록시멀 연산자를 활용한다.
  • 이론적 보장을 갖는 국소 최적해 수렴을 보장하기 위해 선형 탐색 전략을 사용한다.

실험 결과

연구 질문

  • RQ1비볼록이고 비연속적인 소프트 마진 SVM 모델인 $L_{0/1}$-SVM에 대해 엄밀한 최적성 이론을 수립할 수 있는가?
  • RQ2표준 이중 공식이 존재하지 않는 상황에서 P-정류 조건과 연결된 $L_{0/1}$ 서포트 벡터를 어떻게 체계적으로 정의할 수 있는가?
  • RQ3P-정류 조건에 기반한 작업 세트 전략이 $L_{0/1}$-SVM 해법에서 계산 비용을 크게 줄일 수 있는가?
  • RQ4제안된 $L_{0/1}$ ADMM 알고리즘이 대규모 데이터셋에서 기존 SVM 솔버보다 계산 속도와 서포트 벡터 수 측면에서 뛰어나게 성능을 발휘하는가?
  • RQ5실제 데이터에서 레이블 노이즈와 이방성 요소가 존재할 경우 $L_{0/1}$-SVM 및 그 솔버의 성능은 얼마나 강인한가?

주요 결과

  • $L_{0/1}$ ADMM 솔버는 대부분의 데이터셋에서 가장 높은 분류 정확도(ACC)를 기록했으며, col 데이터셋에서는 90% 이상을 달성했고, HSVM과 PSVM는 80% 미만에 머물렀다.
  • $L_{0/1}$ ADMM에서 유도된 서포트 벡터 수(NSV)는 모든 솔버 중에서 가장 일관되게 적었으며, 레이블 노이즈 증가에 따라 안정적이거나 약간 감소하는 경향을 보였다.
  • 10만 개의 샘플을 가진 ijc 데이터셋에서 $L_{0/1}$ ADMM는 0.573초에 실행되었고, HSVM의 36.95초 대비 64배 빠른 성능을 보였다.
  • 1,000만 개 이상의 샘플을 가진 hig 데이터셋에서는 $L_{0/1}$ ADMM가 14.26초 내로 완료되어 확장성의 우수성을 입증했다.
  • 모든 데이터셋에서 작업 세트 크기(SWS/ITER)는 작고 안정적인 경향을 보였으며, 제안된 작업 세트 전략의 효율성을 확인했다.
  • 노이즈 증가 조건에서도 시행 반복 수(TNI)는 낮고 안정적인 경향을 유지하여 알고리즘의 강인성과 효율적인 수렴을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.