Skip to main content
QUICK REVIEW

[論文レビュー] Support Vector Machine Classifier via $L_{0/1}$ Soft-Margin Loss

Huajun Wang, Yuan‐Hai Shao|arXiv (Cornell University)|Dec 16, 2019
Sparse and Compressive Sensing Techniques参考文献 55被引用数 7
ひとこと要約

本稿では、誤分類サンプルとサポートベクターを最小化する非凸で離散的なソフトマージン損失を用いた $L_{0/1}$-SVM分類器を提案する。P-停留点を用いた最適性理論を確立し、$L_{0/1}$ サポートベクターを定義し、作業セット戦略を組み込んだ高速なプロキシマル ADMM を開発することで、特に大規模データセットにおいて優れた速度と少ないサポートベクターを達成した。

ABSTRACT

Support vector machine (SVM) has attracted great attentions for the last two decades due to its extensive applications, and thus numerous optimization models have been proposed. To distinguish all of them, in this paper, we introduce a new model equipped with an $L_{0/1}$ soft-margin loss (dubbed as $L_{0/1}$-SVM) which well captures the nature of the binary classification. Many of the existing convex/non-convex soft-margin losses can be viewed as a surrogate of the $L_{0/1}$ soft-margin loss. Despite the discrete nature of $L_{0/1}$, we manage to establish the existence of global minimizer of the new model as well as revealing the relationship among its minimizers and KKT/P-stationary points. These theoretical properties allow us to take advantage of the alternating direction method of multipliers. In addition, the $L_{0/1}$-support vector operator is introduced as a filter to prevent outliers from being support vectors during the training process. Hence, the method is expected to be relatively robust. Finally, numerical experiments demonstrate that our proposed method generates better performance in terms of much shorter computational time with much fewer number of support vectors when against with some other leading methods in areas of SVM. When the data size gets bigger, its advantage becomes more evident.

研究の動機と目的

  • 非凸的で不連続なソフトマージン SVM モデルである理論的に望ましいが NP 困難な $L_{0/1}$-SVM の、厳密な最適性理論の欠如に取り組む。
  • 標準的な双対定式が得られない中で、P-停留点に基づいて $L_{0/1}$ サポートベクターを形式的に定義し、根拠に基づいた作業セット戦略を可能にする。
  • 強い実験的性能を示す非凸 $L_{0/1}$-SVM 問題を効率的かつスケーラブルに解くアルゴリズムを開発する。
  • 特に大規模データに対して、$L_{0/1}$-SVM が最先端の SVM ソルバーと比較して、サポートベクターの数を減らし、収束が速いことを実証する。

提案手法

  • P-停留点を用いて、$L_{0/1}$-SVM のグローバル最適解の存在を確立し、最適性条件を導出する。
  • 双対問題が不連続性のため明示的に導出できないにもかかわらず、双対問題における非ゼロラグランジュ乗数に対応するベクトルとして、$L_{0/1}$ サポートベクターを定義する。
  • P-停留点条件に基づく作業セット戦略を提案し、1イテレーションあたりの計算コストを低減し、収束を加速する。
  • 非凸な $L_{0/1}$-SVM 問題を解くために、作業セットをプロキシマル交替方向乗数法(ADMM)に統合する。
  • ADMM フレームワーク内で非凸で不連続な損失関数を扱うために、$L_{0/1}$ プロキシマル作用素を用いる。
  • 理論的保証を備えた局所最適解への収束を保証するため、ラインサーチ戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1非凸的かつ不連続なソフトマージン SVM モデルである $L_{0/1}$-SVM に対して、厳密な最適性理論を確立できるか?
  • RQ2標準的な双対定式が得られない状況下で、P-停留点と関連づけた $L_{0/1}$ サポートベクターを形式的に定義できるか?
  • RQ3P-停留点に基づく作業セット戦略が、$L_{0/1}$-SVM の解法において計算コストを顕著に低減できるか?
  • RQ4提案された $L_{0/1}$ ADMM アルゴリズムは、大規模データセットにおいて、計算速度とサポートベクターの数の両面で既存の SVM ソルバーを上回るか?
  • RQ5実世界のデータにおけるラベルノイズや外れ値に対して、$L_{0/1}$-SVM 及びそのソルバーはどれほど頑健か?

主な発見

  • $L_{0/1}$ ADMM ソルバーは、特に col データセットで90%を超える分類精度(ACC)を達成し、HSVM や PSVM が80%未満にとどまる中で、最も高い精度を示した。
  • $L_{0/1}$ ADMM が得るサポートベクターの数(NSV)は、すべてのソルバーの中で常に最小であり、ラベルノイズが増加しても安定的またはわずかに減少する傾向を示した。
  • 10万サンプルを含む ijc データセットでは、$L_{0/1}$ ADMM は 0.573 秒で実行されたのに対し、HSVM は 36.95 秒を要し、大規模データで64倍の高速化を達成した。
  • 1000万件以上のサンプルを含む hig データセットでは、$L_{0/1}$ ADMM が 14.26 秒で完了し、そのスケーラビリティを示した。
  • すべてのデータセットにおいて、作業セットサイズ(SWS/ITER)は小さく安定しており、提案された作業セット戦略の効率性を裏付けた。
  • ラベルノイズが増加しても、試行イテレーション数(TNI)は低く安定しており、収束の効率性と頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。