Skip to main content
QUICK REVIEW

[論文レビュー] Fast Incremental SVDD Learning Algorithm with the Gaussian Kernel

Hansi Jiang, Haoyu Wang|arXiv (Cornell University)|Sep 1, 2017
Anomaly Detection Techniques and Applications参考文献 8被引用数 15
ひとこと要約

本稿では、ガウスカーネルを用いたサポートベクターデータ記述(SVDD)の高速インクリメンタル学習アルゴリズムFISVDDを提案する。行列演算と、特徴空間における境界サポートベクタがすべて中心からの距離が等しいという不変性を利用することで、FISVDDは各反復でサポートベクタと新しいデータポイントのみを更新し、1ステップあたりO(k²)の計算量を達成する。これにより、インクリメンタルSVMに比べて最大100倍の高速化を実現しながら、ほぼグローバル最適な性能を発揮し、外れ値検出の精度を維持する。

ABSTRACT

Support vector data description (SVDD) is a machine learning technique that is used for single-class classification and outlier detection. The idea of SVDD is to find a set of support vectors that defines a boundary around data. When dealing with online or large data, existing batch SVDD methods have to be rerun in each iteration. We propose an incremental learning algorithm for SVDD that uses the Gaussian kernel. This algorithm builds on the observation that all support vectors on the boundary have the same distance to the center of sphere in a higher-dimensional feature space as mapped by the Gaussian kernel function. Each iteration involves only the existing support vectors and the new data point. Moreover, the algorithm is based solely on matrix manipulations; the support vectors and their corresponding Lagrange multiplier $α_i$'s are automatically selected and determined in each iteration. It can be seen that the complexity of our algorithm in each iteration is only $O(k^2)$, where $k$ is the number of support vectors. Experimental results on some real data sets indicate that FISVDD demonstrates significant gains in efficiency with almost no loss in either outlier detection accuracy or objective function value.

研究の動機と目的

  • 大規模またはストリーミングデータを処理する際、バッチ処理およびインクリメンタルSVDD手法の非効率性を解消すること。
  • 計算コストを著しく削減しながらも高い精度を維持するオンライン学習アルゴリズムの開発。
  • カーネル空間におけるサポートベクタの幾何的不変性を活用し、インクリメンタル更新の簡素化と高速化を実現すること。
  • 低遅延を実現し、IoTや産業監視などの応用分野におけるリアルタイムの外れ値検出を可能にすること。
  • 全再訓練を回避し、各反復後に内部点を破棄することで、メモリおよび計算コストの負荷を低減すること。

提案手法

  • FISVDDは、カーネル行列およびその逆行列における変化を効率的に計算するため、行列の逆行列更新を用いる。
  • 逆カーネル行列A⁻¹の各行の和の符号に基づき、サポートベクタと内部点を特定する。
  • ラグランジュ乗数αᵢは、A⁻¹の各行の和の成分の大きさによって決定される。
  • 各反復後に内部点を破棄することで、ストレージおよび計算コストを削減する。
  • 本手法は、ガウスカーネルによって誘導される高次元の特徴空間において、すべてのサポートベクタが中心からの距離が等しいという鍵となる洞察に基づく。
  • 本手法は本質的にインクリメンタルである。各更新は、現在のサポートベクタと新しいデータポイントにのみ依存し、全データセットに依存しない。

実験結果

リサーチクエスチョン

  • RQ1インクリメンタルSVDDアルゴリズムは、計算コストを著しく削減しながらも、ほぼグローバル最適な性能を達成できるか?
  • RQ2カーネル空間におけるサポートベクタの幾何的不変性をどのように活用し、学習の簡素化と高速化を実現できるか?
  • RQ3各反復後に内部点を破棄しても、モデルの精度が著しく低下しない範囲はどの程度か?
  • RQ4既存のインクリメンタルSVMベースのSVDD手法と比較して、提案手法の効率性と精度はどのように異なるか?
  • RQ5行列の逆行列更新によって、1反復あたりO(k²)の計算量を達成しながら、モデルの安定性および収束性を維持できるか?

主な発見

  • FISVDDはインクリメンタルSVMに比べ最大100倍の高速化を達成し、Shuttleデータセットでは251.01秒(FISVDD)対22,923.57秒(インクリメンタルSVM)の訓練時間となった。
  • FISVDDの目的関数値は、インクリメンタルSVMのベースラインと0.05%以内の差異にとどまり、ほぼグローバル最適性を示した。
  • CoverTypeデータセットでは、FISVDDは19.47秒で学習が完了したが、インクリメンタルSVMは12,954.81秒を要し、目的関数値の差はわずか0.0027%であった。
  • FISVDDとインクリメンタルSVMの両者において、外れ値検出のF-1スコアはすべてのデータセットでほぼ同一であり、内部点を破棄しても影響がなかった。
  • FISVDDとインクリメンタルSVMの間で、サポートベクタの数に大きな差がなく、モデルのコンパクト性に劣化は認められなかった。
  • FISVDDは、高次元(例:CoverType、10変数)および低次元(例:SMTP、3変数)の多様なデータタイプに対して、堅牢な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。