Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Learning to Detect Concept Drift

Hang Yu, Tianyu Liu|arXiv (Cornell University)|2021. 05. 04.
Data Stream Mining Techniques참고 문헌 21인용 수 6
한 줄 요약

이 논문은 원형 네트워크를 통해 오차율 패턴을 학습함으로써 데이터 스트림에서의 개념 이탈을 자동으로 탐지하고 분류하는 메타학습 프레임워크인 Meta-ADD를 제안한다. 기존 방법보다 이격 탐지 정확도와 F1 스코어에서 뛰어난 성능을 보이며, 합성 데이터에서 89.2%의 정확도와 0.85의 F1 스코어를 기록했고, 초기 웜업 윈도우 없이 실시간 분류를 가능하게 한다.

ABSTRACT

Many methods have been proposed to detect concept drift, i.e., the change in the distribution of streaming data, due to concept drift causes a decrease in the prediction accuracy of algorithms. However, the most of current detection methods are based on the assessment of the degree of change in the data distribution, cannot identify the type of concept drift. In this paper, we propose Active Drift Detection with Meta learning (Meta-ADD), a novel framework that learns to classify concept drift by tracking the changed pattern of error rates. Specifically, in the training phase, we extract meta-features based on the error rates of various concept drift, after which a meta-detector is developed via a prototypical neural network by representing various concept drift classes as corresponding prototypes. In the detection phase, the learned meta-detector is fine-tuned to adapt to the corresponding data stream via stream-based active learning. Hence, Meta-ADD uses machine learning to learn to detect concept drifts and identify their types automatically, which can directly support drift understand. The experiment results verify the effectiveness of Meta-ADD.

연구 동기 및 목표

  • 초기 데이터 윈도우 수집 기간 동안 탐지가 불가능한 개념 이탈 탐지의 냉시작 문제를 해결하기 위해.
  • 기존 방법이 이격 발생 여부만 탐지할 수 있고 유형을 분류하지 못하는 한계를 극복하기 위해.
  • 기계 학습을 활용해 자동으로 실시간으로 개념 이격 유형을 분류할 수 있도록 하기 위해.
  • 다양한 데이터 스트림에 일반화되고 능동 학습을 통해 적응 가능한 메타 탐지기 개발하기 위해.
  • 다양한 이격 유형과 관련된 구분 가능한 오차율 패턴을 학습함으로써 탐지 정확도 향상시키기 위해.

제안 방법

  • 프리트레이닝 기간 동안 다양한 개념 이격 유형의 오차율 패턴에서 메타특징을 추출한다.
  • 각 개념 이격 유형을 단일 프로토타입으로 표현하기 위해 원형 신경망을 활용하여 소수의 예제로도 분류가 가능하게 한다.
  • 다양한 이격 패턴에서 학습을 통해 일반화 능력을 확보하기 위해 메타학습 전략을 적용한다.
  • 스트림 기반 능동 학습(SAL)을 사용해 메타 탐지기를 온라인으로 미세조정하여 특정 데이터 스트림의 분포에 적응시킨다.
  • 초기 웜업 윈도우가 필요 없이 실시간으로 이격 유형을 분류한다.
  • 부족한 각 유형의 학습 예제와 풍부한 이격 유형 간의 불균형을 소수의 예제 학습 기반으로 처리한다.

실험 결과

연구 질문

  • RQ1수동 규칙에 의존하지 않고 오프라인으로 학습된 기계 학습 모델이 개념 이격 유형을 탐지하고 분류할 수 있는가?
  • RQ2메타학습이 다양한 데이터 스트림 간 일반화 능력을 갖추고 새로운 이격 패턴에 신속히 적응할 수 있도록 할 수 있는가?
  • RQ3스트림 기반 능동 학습이 실제 데이터 스트림에서의 개념 이격 탐지 정확도를 향상시키는가?
  • RQ4제안된 프레임워크가 개념 이격 탐지의 냉시작 문제를 해결할 수 있는가?
  • RQ5Meta-ADD의 성능은 정확도와 F1 스코어 측면에서 최신 기술 대비 어떻게 비교되는가?

주요 결과

  • Meta-ADD는 합성 토이 데이터셋에서 89.2%의 정확도와 0.85의 F1 스코어를 기록했으며, Meta-DD 및 기존 방법을 포함한 모든 베이스라인을 능가했다.
  • 실제 데이터셋에서는 Elec 데이터셋에서 최고의 정확도(85.7%)를 기록했고, Spam 데이터셋에서는 95.2%의 정확도를 기록했으며, 경쟁 방법들보다 더 적은 거짓 양성 결과를 보였다.
  • 능동 학습 구성 요소가 탐지 성능 향상에 기여했음을 보여주며, 모든 데이터셋에서 일관된 F1 스코어 상승이 관찰되었다.
  • 윈도우 크기(l 및 n)가 커질수록 탐지된 이격 수가 감소하여, 매개변수를 적절히 조정할 경우 거짓 양성 결과를 더 잘 제어할 수 있음을 시사했다.
  • Meta-ADD는 첫 번째 데이터 포인트부터 즉각적인 이격 탐지 및 분류가 가능하게 함으로써 냉시작 문제를 성공적으로 제거했다.
  • Poke 및 Air와 같은 고차원 및 장기 시퀀스 데이터셋을 포함한 다양한 데이터 스트림에서 프레임워크의 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.