Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Learning to Detect Concept Drift

Hang Yu, Tianyu Liu|arXiv (Cornell University)|May 4, 2021
Data Stream Mining Techniques参考文献 21被引用数 6
ひとこと要約

本稿では、プロトタイプネットワークを用いて誤差率パターンを学習することで、データストリームにおける概念ずれを自動で検出・分類するメタラーニングフレームワーク、Meta-ADDを提案する。従来手法を上回るずれ検出精度とF1スコアを達成し、合成データで89.2%の精度と0.85のF1スコアを記録するとともに、初期ウォームアップウィンドウを必要とせずリアルタイム分類を可能にする。

ABSTRACT

Many methods have been proposed to detect concept drift, i.e., the change in the distribution of streaming data, due to concept drift causes a decrease in the prediction accuracy of algorithms. However, the most of current detection methods are based on the assessment of the degree of change in the data distribution, cannot identify the type of concept drift. In this paper, we propose Active Drift Detection with Meta learning (Meta-ADD), a novel framework that learns to classify concept drift by tracking the changed pattern of error rates. Specifically, in the training phase, we extract meta-features based on the error rates of various concept drift, after which a meta-detector is developed via a prototypical neural network by representing various concept drift classes as corresponding prototypes. In the detection phase, the learned meta-detector is fine-tuned to adapt to the corresponding data stream via stream-based active learning. Hence, Meta-ADD uses machine learning to learn to detect concept drifts and identify their types automatically, which can directly support drift understand. The experiment results verify the effectiveness of Meta-ADD.

研究の動機と目的

  • 初期データウィンドウ収集中には検出が不可能であるという、概念ずれ検出におけるコールドスタート問題に対処すること。
  • 従来手法がずれの発生を検出できるものの、そのタイプを分類できないという制限を克服すること。
  • 機械学習を用いて、自動的かつリアルタイムに概念ずれタイプを分類可能にする仕組みを実現すること。
  • 多様なデータストリームに一般化可能で、アクティブラーニングにより適応するメタ検出器を開発すること。
  • 異なるずれタイプに関連する判別性のある誤差率パターンを学習することで、検出精度を向上させること。

提案手法

  • 事前学習段階で、さまざまな概念ずれタイプの誤差率パターンからメタ特徴を抽出する。
  • 各概念ずれクラスを1つのプロトタイプとして表現するため、プロトタイプニューラルネットワークを採用し、少数ショット分類を可能にする。
  • 多様なずれパターンで訓練するメタラーニング戦略を用いることで、未観測のデータストリームに対しても一般化を可能にする。
  • ストリームベースアクティブラーニング(SAL)を用いて、オンラインでメタ検出器を微調整し、特定のデータストリームの分布に適応する。
  • 初期ウォームアップウィンドウを必要とせず、リアルタイムにずれタイプを分類する。
  • 少数ショットラーニングを活用することで、豊富なずれタイプと、各タイプの限られたトレーニング例との間の不均衡に対処する。

実験結果

リサーチクエスチョン

  • RQ1手動で設計されたルールに依存せずに、オフラインで学習した機械学習モデルが、概念ずれタイプの検出と分類が可能かどうか。
  • RQ2メタラーニングが、多様なデータストリームに一般化し、新しいずれパターンに素早く適応できる検出器を可能にするか。
  • RQ3ストリームベースアクティブラーニングが、実世界のデータストリームにおける概念ずれ検出の精度を向上させるか。
  • RQ4提案されたフレームワークが、概念ずれ検出におけるコールドスタート問題を解消できるか。
  • RQ5Meta-ADDの性能は、最新のずれ検出手法と比較して、精度およびF1スコアの観点でどのように異なるか。

主な発見

  • Meta-ADDは合成トイデータセットで89.2%の精度と0.85のF1スコアを達成し、Meta-DDや従来手法をすべて上回った。
  • 実世界のデータセットでは、Elecデータセットで最高の精度(85.7%)を記録し、Spamデータセットでは95.2%の精度を達成した。また、競合手法よりも誤検出が少なかった。
  • アクティブラーニング部が検出性能を向上させたことが、すべてのデータセットでF1スコアの一貫した上昇によって示された。
  • ウィンドウサイズ(lおよびn)が大きくなるにつれて検出されたずれの数が減少し、パrameterを最適化することで誤検出がよりよく制御されることを示した。
  • Meta-ADDは、最初のデータポイントから即座にずれ検出と分類が可能であるため、コールドスタート問題を効果的に解消した。
  • PokeやAirのような高次元および長時間系列データストリームを含む多様なデータストリームにおいて、堅牢な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。