Skip to main content
QUICK REVIEW

[논문 리뷰] Automating Outlier Detection via Meta-Learning

Yue Zhao, Ryan A. Rossi|arXiv (Cornell University)|2020. 09. 22.
Anomaly Detection Techniques and Applications참고 문헌 51인용 수 12
한 줄 요약

이 논문은 벤치마크 데이터셋을 통해 역사적 성능 데이터를 활용하여 이상치 탐지 모델 선택을 자동화하는 메타학습 프레임워크인 MetaOD를 제안한다. 특수화된 메타특성들을 사용하여 데이터셋의 이상치 특성을 정량화함으로써, 레이블이 없이도 빠르고 단일 스텝 내에 최적의 탐지기와 하이퍼파라미터를 선택할 수 있으며, 상태기반 기술들 및 LOF, iForest와 같은 인기 있는 탐지기들을 뛰어넘는 성능을 보이며 극히 낮은 오버헤드를 유발한다.

ABSTRACT

Given an unsupervised outlier detection (OD) task on a new dataset, how can we automatically select a good outlier detection method and its hyperparameter(s) (collectively called a model)? Thus far, model selection for OD has been a "black art"; as any model evaluation is infeasible due to the lack of (i) hold-out data with labels, and (ii) a universal objective function. In this work, we develop the first principled data-driven approach to model selection for OD, called MetaOD, based on meta-learning. MetaOD capitalizes on the past performances of a large body of detection models on existing outlier detection benchmark datasets, and carries over this prior experience to automatically select an effective model to be employed on a new dataset without using any labels. To capture task similarity, we introduce specialized meta-features that quantify outlying characteristics of a dataset. Through comprehensive experiments, we show the effectiveness of MetaOD in selecting a detection model that significantly outperforms the most popular outlier detectors (e.g., LOF and iForest) as well as various state-of-the-art unsupervised meta-learners while being extremely fast. To foster reproducibility and further research on this new problem, we open-source our entire meta-learning system, benchmark environment, and testbed datasets.

연구 동기 및 목표

  • 레이블이 없고 통합 목적 함수가 없는 상황에서 비지도 이상치 탐지의 원칙적인 모델 선택 부족 문제를 해결하기 위해.
  • 레이블 데이터나 반복 평가 없이도 새로운 데이터셋에 대해 최적의 이상치 탐지 방법과 하이퍼파라미터를 자동으로 선택하기 위해.
  • 기존의 모델 성능을 벤치마크 데이터셋에서 일반화하여 새로운 작업에 적용할 수 있는 데이터 기반의 메타학습 기반 접근법을 구축하기 위해.
  • 데이터셋 내 이상치 특성을 잘 반영할 수 있도록 도메인 특화 메타특성을 설계하여 작업 유사도 추정을 향상시키기 위해.
  • 미래의 자동 이상치 탐지 연구를 위한 재현 가능하고 오픈소스 플랫폼을 제공하기 위해.

제안 방법

  • MetaOD는 이상치 탐지 작업을 메타특성으로 캡처한 이전의 벤치마크 데이터셋과 유사도 기반으로 매핑하는 메타학습 프레임워크를 사용한다.
  • 밀도, 차원 수, 이상치 분포 통계량 등의 메타특성을 계산하여 신규 데이터셋과 이전 데이터셋 간의 작업 유사도를 정량화한다.
  • 협업 필터링을 영감으로 삼아 유사한 이전 작업들에서의 과거 모델 성능을 가중 평균하는 방식으로 새로운 작업에서의 모델 성능을 예측한다.
  • 냉각기반 추천 시스템에 비유하여 각 신규 데이터셋을 새로운 사용자로, 각 탐지기를 평가가 없는 항목으로 간주한다.
  • 신규 데이터셋에서 메타특성을 추출하고, 예측 성능가장 높은 모델을 단일 추론 스텝 내에서 선택한다.
  • 이 방법은 매우 효율적이며, 메타특성 추출 및 성능 예측 과정에서 모델 학습 대비 극히 낮은 런타임 오버헤드를 유발한다.

실험 결과

연구 질문

  • RQ1레이블이 없는 상황에서 메타학습이 이상치 탐지 모델 선택을 효과적으로 자동화하는 데 적용될 수 있는가?
  • RQ2어떤 유형의 메타특성이 작업 유사도 추정을 위해 데이터셋의 이상치 특성을 가장 잘 포괄하는가?
  • RQ3MetaOD는 상태기반 비지도 메타러닝 기술 및 LOF, iForest와 같은 인기 있는 이상치 탐지기와 비교해 성능에서 뛰어나게 되는가?
  • RQ4MetaOD는 낮은 계산 오버헤드를 통해 실세계 구현에 실용적인가?
  • RQ5MetaOD는 다양한 데이터셋과 이상치 탐지 시나리오에 대해 얼마나 강건한가?

주요 결과

  • MetaOD는 LOF, iForest와 같은 인기 있는 탐지기들을 포함한 모든 베이스라인보다 평균 정밀도(평균 정밀도, MAP) 측면에서 뚜렷이 뛰어나며, POC 벤치마크에서 MAP 0.3382를 기록했다.
  • 모든 데이터셋에서 평균 순위 6.87을 기록하여, 순위 기반으로는 iForest를 제외한 모든 베이스라인보다 통계적으로 유의미하게 뛰어났다 (쌍대 Wilcoxon 순위합 검정).
  • 메타특성 추출 및 모델 선택 과정에서 극히 낮은 런타임 오버헤드를 보였으며, 일정 시간 내에 수행되며 병렬 처리가 매우 용이했다.
  • MetaOD는 MetaOD_C, MetaOD_F, RS와 같은 다른 메타러닝 기반 기술보다도 유의미하게 뛰어난 성능을 보였으며, 대부분의 비교에서 통계적으로 유의미한 향상(α < 0.05)을 보였다.
  • 이상치 특성에 특화된 전용 메타특성의 사용은 일반적이거나 비이상치에 특화되지 않은 특성보다 더 정확한 작업 유사도 추정을 가능하게 했다.
  • 오픈소스로 제공된 MetaOD 시스템과 벤치마크 테스트베드는 향후 자동 이상치 탐지 분야의 연구를 위한 재현 가능한 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.