Skip to main content
QUICK REVIEW

[논문 리뷰] Quantum Entropy Scoring for Fast Robust Mean Estimation and Improved Outlier Detection

Yihe Dong, Samuel B. Hopkins|arXiv (Cornell University)|2019. 06. 26.
Fault Detection and Control Systems참고 문헌 25인용 수 33
한 줄 요약

양자 엔트로피 정규화를 통한 QUE 점수 도입으로 거의 선형 시간의 강건한 평균 추정과 효과적인 고차원 이상치 탐지 달성, 이론적 보장과 실증 검증 포함.

ABSTRACT

We study two problems in high-dimensional robust statistics: \emph{robust mean estimation} and \emph{outlier detection}. In robust mean estimation the goal is to estimate the mean $μ$ of a distribution on $\mathbb{R}^d$ given $n$ independent samples, an $\varepsilon$-fraction of which have been corrupted by a malicious adversary. In outlier detection the goal is to assign an \emph{outlier score} to each element of a data set such that elements more likely to be outliers are assigned higher scores. Our algorithms for both problems are based on a new outlier scoring method we call QUE-scoring based on \emph{quantum entropy regularization}. For robust mean estimation, this yields the first algorithm with optimal error rates and nearly-linear running time $\widetilde{O}(nd)$ in all parameters, improving on the previous fastest running time $\widetilde{O}(\min(nd/\varepsilon^6, nd^2))$. For outlier detection, we evaluate the performance of QUE-scoring via extensive experiments on synthetic and real data, and demonstrate that it often performs better than previously proposed algorithms. Code for these experiments is available at https://github.com/twistedcubic/que-outlier-detection .

연구 동기 및 목표

  • 적대적 손상 하에서 고차원에서의 강건한 평균 추정 및 이상치 탐지 동기를 부여한다.
  • 양자 엔트로피 정규화에 기반한 QUE 점수를 개발하여 이상치의 영향 있는 방향을 식별한다.
  • 한정된 공분산 및 서-가우시안 체제에서 강건한 평균 추정에 대한 거의 선형 시간 알고리즘을 달성한다.
  • QUE 점수와 스펙트럴 정보를 활용한 경험적으로 검증된 이상치 탐지 방법을 제공한다.

제안 방법

  • QUE 점수를 정의 U = exp(alpha * \u0003b1overSigma) / tr exp(alpha * \u0003b1overSigma) 로, 여기서 overSigma는 경험적 공분산이고 alpha는 조정 매개변수이다.
  • QUE를 매트릭스 곱셈 가중치 프레임워크에 통합하여 의심되는 이상치를 반복적으로 낮게 가중치를 부여한다.
  • 가중 공분산의 스펙럴 노름을 O(log d) 라운드로 감소시키기 위한 DecreaseSpectralNorm 서브루틴을 사용한다.
  • 두 가지 알고리즘 변형을 제공한다: bounded covariance용 QUEScoreFilter와 sub-Gaussian 분포용 s.g.-QUEScoreFilter.
  • 여러 개의 큰 고유 방향을 고려하여 순진한 스펙트럴 점수보다 QUE 기반 점수가 개선됨을 보인다.
  • 저랭크 스케치를 통해 명시적 행렬 표현을 피함으로써 거의 선형 시간 실행을 입증한다.

실험 결과

연구 질문

  • RQ1다양한 이상치 방향을 가진 고차원 데이터에서 QUE 점수가 이상치를 더 효과적으로 탐지할 수 있는가?
  • RQ2한정된 공분산 및 서-가우시안 가정 하에서 거의 선형 시간으로 근사 최적 오류에 도달하는 강건한 평균 추정이 가능할까?
  • RQ3실제로 QUE 점수는 기존 베이스라인(노름 기반, 가장 큰 고유벡터 스펙트럴, 로컬 방법)과 어떻게 비교되는가?
  • RQ4엔트로피 정규화 매개변수 alpha가 성능에 미치는 영향은 무엇인가?

주요 결과

  • QUE 점수화는 한정된 공분산 아래에서 근사 오차 兀兀\u001233sqrt(epsilon) + ~sqrt(d/n)로 거의 선형 시간의 강건한 평균 추정을 이끈다.
  • Sub-Gaussian 케이스는 兀兀O(epsilon sqrt(log(1/epsilon)) + sqrt(d/n)) 오차 한계를 높은 확률로 달성한다.
  • QUE 기반 이상치 점수는 고차원 실험에서 종종 PCA 기반, 거리 기반 및 기타 베이스라인보다 우수하다.
  • 합성 데이터, 단어 임베딩, CIFAR-10 데이터에 대한 실험은 다양한 설정에서 QUE가 ROCAUC 점수를 개선함을 보여준다.
  • 실용적인 구현은 Johnson-Lindenstrauss 스케치와 행렬 지수 근사치를 사용하여 거의 선형 시간에 근사 QUE 점수를 계산한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.