Skip to main content
QUICK REVIEW

[論文レビュー] Classification under Streaming Emerging New Classes: A Solution using Completely Random Trees

Xin Mu, Kai Ming Ting|arXiv (Cornell University)|May 30, 2016
Data Stream Mining Techniques参考文献 19被引用数 14
ひとこと要約

本稿では、ストリーミング環境における新規クラスの出現(SENC)問題を解決するため、完全にランダムな木を用いた教師なし異常検出に特化したSENCForestを提案する。新規クラス検出を異常検出タスクとして扱うことで、分類に特化したベースラインと比較して優れた性能を発揮し、特に新規クラスの早期検出と、再訓練を伴わない効率的なモデル更新が可能になる。

ABSTRACT

This paper investigates an important problem in stream mining, i.e., classification under streaming emerging new classes or SENC. The common approach is to treat it as a classification problem and solve it using either a supervised learner or a semi-supervised learner. We propose an alternative approach by using unsupervised learning as the basis to solve this problem. The SENC problem can be decomposed into three sub problems: detecting emerging new classes, classifying for known classes, and updating models to enable classification of instances of the new class and detection of more emerging new classes. The proposed method employs completely random trees which have been shown to work well in unsupervised learning and supervised learning independently in the literature. This is the first time, as far as we know, that completely random trees are used as a single common core to solve all three sub problems: unsupervised learning, supervised learning and model update in data streams. We show that the proposed unsupervised-learning-focused method often achieves significantly better outcomes than existing classification-focused methods.

研究の動機と目的

  • 時間の経過に伴い新規クラスが出現するデータストリームにおいて、高い分類精度を維持する課題に対処すること。
  • 既存の分類に特化したアプローチが、新規クラスの早期かつ正確な検出に苦労するという限界を克服すること。
  • 完全にランダムな木を共通コアとして用いることで、異常検出、分類、モデル更新を統合した統一フレームワークを構築すること。
  • メモリ制約下でも、元のトレーニングデータを必要とせずに、効率的なモデル更新を可能にすること。
  • 既知のクラスに対する強固な分類性能を維持しつつ、新規クラスの検出精度を高めること。

提案手法

  • 完全にランダムな木を、教師なし異常検出、教師あり分類、モデル更新の共通コアとして用いる。
  • 完全にランダムな木の教師なし異常検出機能を活用し、既知クラスとは外れることで、新規クラスの候補を特定する。
  • インスタンスをフィルタリング:既知クラスの異常でない場合は分類器に渡し、異常である場合は新規クラスの候補とみなす。
  • 検出された新規クラス候補をバッファに格納し、バッファが満杯になった時点でのみ分類器と検出器を更新する。
  • 再訓練からではなく、既存の木のアンサンブルを調整することでモデル更新を実行し、ストリーミング環境での迅速な適応を可能にする。
  • 完全にランダムな木の内在的な構造を活用し、既知クラスの異常と真の新規クラスを区別する。

実験結果

リサーチクエスチョン

  • RQ1教師なし異常検出に特化したアプローチは、従来の分類に特化した手法よりも、ストリームにおける新規クラスの検出で優れた性能を発揮できるか?
  • RQ21つのモデルコア(完全にランダムな木)が、SENC環境において、教師なし異常検出器と教師あり分類器の両方として効果的に機能できるか?
  • RQ3運用時において真のクラスラベルが入手不可な状況でも、本手法の検出精度と分類性能はどの程度の水準に達するか?
  • RQ4初期トレーニングセットから再訓練を伴わずに、どの程度効率的にモデル更新が可能になるか?
  • RQ5メモリ制約下で、複数の新規クラスが繰り返し出現する長時間のストリームにおいて、本手法はどの程度スケーラブルか?

主な発見

  • SENCForestは、運用時において真のクラスラベルを一切受け取らないにもかかわらず、8つの既存手法を上回る分類精度と新規クラス検出性能を達成した。
  • 分類に特化したアプローチと比較して、新規クラスの検出精度が顕著に高く、多くの場合、新規クラスの早期検出に失敗する傾向がある。
  • 複数の新規クラスが出現する長時間のストリームでも、SENCForestは高い性能を維持しており、1期間あたり2つの新規クラスが出現するケースにも対応可能である。
  • 再訓練を必要とせず、初期トレーニングセットからも離れて効率的なモデル更新が可能であり、メモリ制約下でのスケーラビリティを実現している。
  • 完全にランダムな木を統合コアとして用いることで、高速な分類とモデル調整が可能となり、リアルタイムのデータストリーム処理に適している。
  • 実験的結果から、新規クラスが既知クラスと明確に分離されていなくても、木の強力な異常検出能力のおかげで、SENCForestは頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。