Skip to main content
QUICK REVIEW

[논문 리뷰] On Coresets for Logistic Regression

Alexander Munteanu, Chris Schwiegelshohn|arXiv (Cornell University)|2018. 05. 22.
Face and Expression Recognition참고 문헌 43인용 수 20
한 줄 요약

이 논문은 유계 μ-복잡도 조건 하에서 처음으로 증명 가능하게 비선형인 (1±ε)-코어셋을 가능하게 하는 새로운 민감도 샘플링 기법을 제안한다. 일반적으로 강하게 비선형 코어셋이 존재하지 않음을 보이며, 하지만 낮은 μ-복잡도를 가지는 데이터—정확하게 추정된 오즈와 잘못 추정된 오즈의 비율을 측정하는 척도—에 대해서는 ℓ₂² 레버리지 점수 기반 민감도 샘플링과 균일 혼합을 통해 강력한 근사 보장을 갖는 비선형 코어셋 크기를 달성할 수 있다.

ABSTRACT

Coresets are one of the central methods to facilitate the analysis of large data sets. We continue a recent line of research applying the theory of coresets to logistic regression. First, we show a negative result, namely, that no strongly sublinear sized coresets exist for logistic regression. To deal with intractable worst-case instances we introduce a complexity measure $μ(X)$, which quantifies the hardness of compressing a data set for logistic regression. $μ(X)$ has an intuitive statistical interpretation that may be of independent interest. For data sets with bounded $μ(X)$-complexity, we show that a novel sensitivity sampling scheme produces the first provably sublinear $(1\pm\varepsilon)$-coreset. We illustrate the performance of our method by comparing to uniform sampling as well as to state of the art methods in the area. The experiments are conducted on real world benchmark data for logistic regression.

연구 동기 및 목표

  • 거대한 데이터 세트에서 로지스틱 회귀를 확장하기 위한 핵심 과제를 데이터 코어셋 구축을 통해 해결하기 위해.
  • 로지스틱 회귀의 코어셋 크기 이론적 한계를 규명하여 일반적으로 강하게 비선형 코어셋이 존재하지 않음을 보여주기 위해.
  • 로지스틱 회귀 데이터 세트의 압축 가능성을 측정하는 새로운 복잡도 척도 μ(X)를 도입하기 위해.
  • μ-복잡도 데이터 세트에 대해 비선형 코어셋 크기를 달성하는 민감도 기반 샘플링 기법을 설계하기 위해.
  • 실세계 벤치마크에서 균일 샘플링 및 k-평균 기반 샘플링과의 비교를 통해 방법의 실증적 검증을 수행하기 위해.

제안 방법

  • 로지스틱 회귀의 데이터 압축 가능성을 측정하기 위해, 정확하게 추정된 오즈의 로그와 잘못 추정된 오즈의 로그의 비율로 정의된 새로운 복잡도 척도 μ(X)를 도입한다.
  • 고영향도 및 저영향도 데이터 포인트를 모두 처리하기 위해 ℓ₂² 레버리지 점수(제곱근)와 균일 샘플링을 융합한 하이브리드 샘플링 분포를 제안한다.
  • 총 민감도가 μ(X)에 따라 유계임을 증명하여, μ-복잡도 데이터에 대해 크기가 O(μ · d · ε⁻² · log μ)인 (1±ε)-코어셋을 구성할 수 있음을 보장한다.
  • 입력 흐름의 흐린 시간 복잡도 Õ(nnz(Z)) 내에서 실행되며, 스트리밍 및 분산 모델(예: MapReduce)을 지원하는 공간 효율적인 알고리즘을 유도한다.
  • 재귀적 코어셋 구축을 통해 코어셋 크기를 n^η로 줄일 수 있으며, 이는 스트리밍 환경에서 2·log(1/η)번의 패assing만으로도 가능하다.
  • 형식적인 코어셋 보장을 갖는 민감도 프레임워크를 활용하여, 임의의 해 β에 대해 코어셋 목적 함수가 전체 데이터 목적 함수를 1±ε 범위 내에서 근사함을 보장한다.

실험 결과

연구 질문

  • RQ1일반 조건 하에서 로지스틱 회귀에 대해 비선형 크기의 코어셋을 구성할 수 있는가?
  • RQ2로지스틱 회귀 데이터가 효과적으로 압축 가능한지를 특징짓는 복잡도 척도는 무엇인가?
  • RQ3로지스틱 회귀의 비제곱형, 비볼록 손실 구조에 맞게 민감도 샘플링을 어떻게 적응시킬 수 있는가?
  • RQ4ℓ₂² 레버리지 점수와 균일 샘플링을 융합한 하이브리드 샘플링 전략이 실질적으로 표준 기준보다 우월한가?
  • RQ5제안된 방법이 최악의 경우를 초월하는 복잡도 모델 하에서 증명 가능하게 비선형 코어셋 크기를 달성할 수 있는가?

주요 결과

  • 최악의 경우에서 로지스틱 회귀에 대해 강하게 비선형 코어셋이 존재하지 않음을 보이며, 기본적인 부정적 결과를 확립한다.
  • 유계 μ를 가지는 μ-복잡도 데이터 세트에 대해 제안된 민감도 샘플링 기법은 크기가 O(μ · d · ε⁻² · log μ)인 (1±ε)-코어셋을 생성하며, 이는 n에 대해 증명 가능하게 비선형이다.
  • 실세계 데이터(Webb Spam, Covertype, KDD Cup '99)에 대한 실험 결과, 제안된 방법이 균일 샘플링 및 k-평균 기반 샘플링보다 로그우도 오차와 실행 시간 모두에서 뛰어난 성능을 보였다.
  • 모든 테스트된 데이터 세트와 코어셋 크기에서 상대적 로그우도 오차 표준편차가 0.05 이하로 유지되었으며, 중앙값 기준 상대 실행 시간은 전체 데이터 최적화의 0.2배 이하였다.
  • 균일 샘플링은 분리 가능하거나 거의 분리 가능한 데이터에서 치명적인 실패를 겪었으며, SGD 실험 결과에서 β₁ 값이 절반 이상의 실행에서 100을 초과하여 낮은 근사 비율을 초래하였다.
  • 재귀적 코어셋 구축을 통해 코어셋 크기를 n^η로 줄일 수 있었으며, 이는 스트리밍 환경에서 2·log(1/η)번의 패assing만으로도 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.