Skip to main content
QUICK REVIEW

[논문 리뷰] Online Semi-Supervised Concept Drift Detection with Density Estimation

Chang Tan, Vincent C. S. Lee|arXiv (Cornell University)|2019. 09. 25.
Data Stream Mining Techniques참고 문헌 25인용 수 4
한 줄 요약

이 논문은 후행 확률 밀도 추정을 이용해 스트리밍 데이터에서 개념 이탈을 온라인 반감성 학습 프레임워크로 탐지하는 방법을 제안한다. 이는 제한된 레이블 데이터로 실시간으로 실제 이탈과 가상 이탈을 모두 탐지할 수 있도록 한다. 제안된 방법은 부분 레이블링 환경에서도 강력한 이탈 탐지 능력을 유지를 하면서도 최신 기술 수준의 예측 성능을 달성한다.

ABSTRACT

Concept drift is formally defined as the change in joint distribution of a set of input variables X and a target variable y. The two types of drift that are extensively studied are real drift and virtual drift where the former is the change in posterior probabilities p(y|X) while the latter is the change in distribution of X without affecting the posterior probabilities. Many approaches on concept drift detection either assume full availability of data labels, y or handle only the virtual drift. In a streaming environment, the assumption of full availability of data labels, y is questioned. On the other hand, approaches that deal with virtual drift failed to address real drift. Rather than improving the state-of-the-art methods, this paper presents a semi-supervised framework to deal with the challenges above. The objective of the proposed framework is to learn from streaming environment with limited data labels, y and detect real drift concurrently. This paper proposes a novel concept drift detection method utilizing the densities of posterior probabilities in partially labeled streaming environments. Experimental results on both synthetic and realworld datasets show that our proposed semi-supervised framework enables the detection of concept drift in such environment while achieving comparable prediction performance to the state-of-the-art methods.

연구 동기 및 목표

  • 완전한 레이블 제공이 불가능한 스트리밍 환경에서 개념 이탈 탐지 과제를 해결하기 위해.
  • 부분 레이블링된 데이터에서 실제 이탈(p(y|X)의 변화)과 가상 이탈(X 분포의 변화이지만 p(y|X)에는 영향이 없는 경우)을 동시에 탐지하기 위해.
  • 예측 성능을 유지하면서도 제한된 감독 정보로도 확장 가능한 온라인 학습 프레임워크를 개발하기 위해.
  • 기존 방법들이 완전한 레이블링을 가정하거나 반감성 설정에서 실제 이탈을 탐지하지 못하는 한계를 극복하기 위해.

제안 방법

  • 후행 확률 p(y|X)의 밀도 추정을 이용해 시간에 따라 변화하는 결합 분포의 변화를 탐지하기 위해.
  • 새로운 데이터가 도착함에 따라 밀도 모델을 점진적으로 갱신하는 온라인 학습 메커니즘을 적용하기 위해.
  • 완전한 레이블링이 필요 없이 반감성 방식으로 레이블러와 레이블 없음 데이터를 모두 활용해 후행 밀도를 추정하기 위해.
  • 시간 창 간의 추정된 후행 밀도에서의 통계적 발산을 모니터링하여 개념 이탈을 탐지하기 위해.
  • 커널 밀도 추정 또는 유사한 비모수적 방법을 사용해 스트리밍 환경에서 변화하는 후행 분포를 모델링하기 위해.
  • 예측 정확도를 개념 이탈 상황에서도 유지하기 위해 이탈 탐지와 모델 재학습을 통합하기 위해.

실험 결과

연구 질문

  • RQ1스트리밍 환경에서 레이블의 일부분만 이용 가능한 상황에서 반감성 프레임워크가 개념 이탈을 효과적으로 탐지할 수 있는가?
  • RQ2제안된 방법은 완전히 감독된 또는 비감독된 대안 대비 실제 이탈과 가상 이탈을 어떻게 탐지하는가?
  • RQ3제한된 레이블링 조건에서 개념 이탈 상황에서도 예측 성능을 어느 정도 유지하는가?
  • RQ4레이블이 부족한 상황에서 후행 분포의 변화에 이탈 탐지 메커니즘이 얼마나 민감한가?

주요 결과

  • 제안된 방법은 부분 레이블링만을 사용함에도 불구하고 최신 기술 수준의 완전 감독 방법과 유사한 예측 성능를 달성한다.
  • 프레임워크는 반감성 조건 하에서 합성 및 실세계 데이터셋에서 실제 및 가상 개념 이탈을 성공적으로 탐지한다.
  • 후행 확률의 밀도 추정은 레이블 가용성이 낮을 때에도 신뢰할 수 있는 이탈 탐지 가능성을 제공한다.
  • 이 방법의 온라인 성격 덕분에 재학습을 처음부터 다시 하지 않고도 실시간 적응과 탐지가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.