Skip to main content
QUICK REVIEW

[논문 리뷰] Effectiveness of Tree-based Ensembles for Anomaly Discovery: Insights, Batch and Streaming Active Learning

Shubhomoy Das, Md. Rakibul Islam|arXiv (Cornell University)|2019. 01. 23.
Anomaly Detection Techniques and Applications참고 문헌 44인용 수 14
한 줄 요약

이 논문은 배치 및 스트리밍 환경에서 효과적인 이상 탐지의 위해 트리 기반 앙상블 방법과 활성 학습을 제안하며, 이상 다양성, 해석 가능성, 레이블 효율성을 향상시키기 위해 압축된 기술 서술 형식과 GLocalized Anomaly Detection (GLAD)를 도입한다. 활성 학습을 통한 앙상블 방법이 비지도 기반 기준보다 유의미하게 뛰어나며, 스트리밍 환경에서도 경쟁적인 성능을 달성함을 입증한다.

ABSTRACT

In many real-world AD applications including computer security and fraud prevention, the anomaly detector must be configurable by the human analyst to minimize the effort on false positives. One important way to configure the detector is by providing true labels (nominal or anomaly) for a few instances. Recent work on active anomaly discovery has shown that greedily querying the top-scoring instance and tuning the weights of ensemble detectors based on label feedback allows us to quickly discover true anomalies. This paper makes four main contributions to improve the state-of-the-art in anomaly discovery using tree-based ensembles. First, we provide an important insight that explains the practical successes of unsupervised tree-based ensembles and active learning based on greedy query selection strategy. We also present empirical results on real-world data to support our insights and theoretical analysis to support active learning. Second, we develop a novel batch active learning algorithm to improve the diversity of discovered anomalies based on a formalism called compact description to describe the discovered anomalies. Third, we develop a novel active learning algorithm to handle streaming data setting. We present a data drift detection algorithm that not only detects the drift robustly, but also allows us to take corrective actions to adapt the anomaly detector in a principled manner. Fourth, we present extensive experiments to evaluate our insights and our tree-based active anomaly discovery algorithms in both batch and streaming data settings. Our results show that active learning allows us to discover significantly more anomalies than state-of-the-art unsupervised baselines, our batch active learning algorithm discovers diverse anomalies, and our algorithms under the streaming-data setup are competitive with the batch setup.

연구 동기 및 목표

  • 트리 기반 앙상블를 활용한 인간-중심 활성 학습을 통해 이상 탐지에서 높은 거짓 양성률 문제를 해결한다.
  • 사람의 레이블링 노력 최소화와 진짜 이상 탐지 최대화를 동시에 달성하는 원칙적인 활성 학습 프레임워크를 개발한다.
  • 압축된 기술 서술 및 규칙 기반 설명과 같은 새로운 형식을 통해 발견된 이상의 해석 가능성과 다양성을 향상시킨다.
  • 새로운 데이터 드리프트 탐지 및 보정 메커니즘을 통해 스트리밍 데이터 환경에서의 강건한 적응을 가능하게 한다.
  • 앙상블 평균화와 탐욕적 쿼리 선택이 이상 탐지에서 효과적인 이유에 대한 이론적 통찰을 제공한다.

제안 방법

  • 트리 기반 앙상블에서 유도된 논리 규칙를 사용하여 이상을 표현하는 압축된 기술 서술(Compact Description, CD) 형식을 도입하여, 해석 가능성과 다양성을 향상시킨다.
  • 레이블 피드백을 통해 특정 인스턴스에 대해 앙상블 구성원의 국소적 관련성을 학습하는 GLocalized Anomaly Detection (GLAD)를 제안하며, 전역 모델의 단순성을 유지한다.
  • 스트리밍 데이터에서 개념 드리프트를 식별하고 원칙적인 방식으로 적응형 모델 업데이트를 유도하기 위해 새로운 데이터 드리프트 탐지 알고리즘을 활용한다.
  • 이상 탐지 성능 향상을 위해 AAD(Anomaly-Aware Distillation) 손실을 사용하여 이상이 τ-분위수 이상의 점수를 얻도록 모델을 훈련시킨다.
  • 앙상블 행동에 대한 이론적 통찰에 기반해, 이상 점수를 가장 높게 갖는 인스턴스를 선택하는 불확실성 샘플링 유사 쿼리 전략을 적용한다.
  • 훈련된 모델에서 베이지안 규칙 세트를 생성하여 이상 인스턴스에 대한 간결하고 인간이 이해할 수 있는 설명을 제공한다.

실험 결과

연구 질문

  • RQ1왜 이상 점수의 앙상블 평균화가 최소, 최대, 중앙값 등의 다른 집계 전략보다 항상 더 우수한 성능을 보이는가?
  • RQ2탐욕적 쿼리 선택이 활성 이상 탐지에서 효과적인 이론적 근거는 무엇인가?
  • RQ3어떻게 압축된 규칙 표현 형식을 통해 트리 기반 앙상블의 이상 탐지에서의 해석 가능성과 다양성을 높일 수 있는가?
  • RQ4트리 기반 앙상블을 활용한 활성 학습이 개념 드리프트가 존재하는 스트리밍 데이터 환경에서도 높은 성능을 유지할 수 있는가?
  • RQ5모델의 해석 가능성 손실 없이 앙상블 구성원의 국소적 관련성을 학습하여 이상 탐지 성능을 향상시킬 수 있는가?

주요 결과

  • 제안된 활성 학습 프레임워크는 배치 및 스트리밍 환경에서 모두 최신 비지도 기반 기준보다 훨씬 더 많은 진짜 이상을 탐지한다.
  • GLAD는 레이블 피드백을 통해 앙상블 구성원의 국소적 관련성을 학습함으로써 기준 방법보다 더 많은 이상을 탐지하는 데 성공한다.
  • 압축된 기술 서술 형식은 효과적으로 이상 인스턴스를 기술하는 다양한 해석 가능한 규칙 세트의 생성을 가능하게 한다.
  • 데이터 드리프트 탐지 알고리즘이 스트리밍 데이터에서의 개념 드리프트를 성공적으로 식별하고 원칙적인 모델 적응을 가능하게 하여 탐지 성능 유지를 달성한다.
  • 실험 결과, 스트리밍 환경에서의 활성 학습이 배치 환경에서의 성능과 경쟁 가능함을 입증하며, 확장성과 강건성을 보여준다.
  • Weahter 데이터셋에서 제안된 BAL 모델은 Mammography에서 약간 낮은 성능을 보였음에도 불구하고 정확도에서 피드백 유도 온라인 최적화 방법을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.