Skip to main content
QUICK REVIEW

[논문 리뷰] Discrepancy, Coresets, and Sketches in Machine Learning

Zohar Karnin, Edo Liberty|arXiv (Cornell University)|2019. 06. 11.
Machine Learning and Algorithms참고 문헌 22인용 수 7
한 줄 요약

이 논문은 기계학습에서 클래스 이질성과 코어세트 및 스케치 복잡도를 연결하는 일반적인 프레임워크를 제안하며, 낮은 이질성 함수 가중치 가족이 로지스틱 회귀, 커널 밀도 추정 및 기타 해석 함수에 대해 크기 $O(\sqrt{d}/\epsilon)$의 작은 코어세트를 허용함을 증명한다. 저자는 낮은 이질성 수열을 생성하기 위한 결정론적 알고리즘을 제시하고, 새로운 머지-레드럭션 최적화 기법을 통해 스트리밍 스케치를 향상시킨다.

ABSTRACT

This paper defines the notion of class discrepancy for families of functions. It shows that low discrepancy classes admit small offline and streaming coresets. We provide general techniques for bounding the class discrepancy of machine learning problems. As corollaries of the general technique we bound the discrepancy (and therefore coreset complexity) of logistic regression, sigmoid activation loss, matrix covariance, kernel density and any analytic function of the dot product or the squared distance. Our results prove the existence of epsilon-approximation O(sqrt{d}/epsilon) sized coresets for the above problems. This resolves the long-standing open problem regarding the coreset complexity of Gaussian kernel density estimation. We provide two more related but independent results. First, an exponential improvement of the widely used merge-and-reduce trick which gives improved streaming sketches for any low discrepancy problem. Second, an extremely simple deterministic algorithm for finding low discrepancy sequences (and therefore coresets) for any positive semi-definite kernel. This paper establishes some explicit connections between class discrepancy, coreset complexity, learnability, and streaming algorithms.

연구 동기 및 목표

  • 클래스 이질성과 기계학습에서의 코어세트 복잡도 간 이론적 연결을 수립하기 위해.
  • 로지스틱 회귀 및 커널 밀도 추정을 포함한 다양한 해석 함수 가족의 이질성에 대한 일반적 방법을 제공하기 위해.
  • 가우시안 커널 밀도 추정에 대한 코어세트 복잡도에 대한 오랜 동안 미해결이었던 문제를 해결하기 위해.
  • 머지-레드럭션 기법의 지수적 향상을 통해 스트리밍 스케치를 향상시키기 위해.
  • 양의 준정부호 커널에 대해 낮은 이질성 수열을 생성하는 결정론적이고 효율적인 알고리즘 개발하기 위해.

제안 방법

  • 코어세트 복잡도를 측정하는 척도로 클래스 이질성을 정의하며, 최적의 코어세트 구성에 맞추어진 라데마처 복잡도와 유사하지만 특화된 방법이다.
  • 반스차르스키의 정리를 적용하여 커널 함수에 대한 부호 합을 통해 함수 가족의 이질성을 유계로 제한한다.
  • 데이터 포인트에 대해 부호 $\sigma_i \in \{-1,1\}$를 할당하여 모든 쿼리에 대해 커널 합의 최대 편차를 최소화하는 탐욕적 결정론적 알고리즘을 도입한다.
  • 이질성 유계 $\max_q |\sum_i \sigma_i K(x_i, q)| \leq \sqrt{m}$ 를 사용하여 $\epsilon$-넷에 대한 유니언 바운드를 통해 코어세트 보장을 도출한다.
  • 스트리밍 환경에서 메모리 사용을 줄이기 위해 이질성 인식 기반의 재귀적 병합 전략을 머지-레드럭션 기법에 통합한다.
  • 커널 사상에 의해 유도된 벡터 공간에서 노름 성장의 유계성을 보장하기 위해 $K(x,x) \leq 1$ 이고 $K$ 가 양의 준정부호임을 활용한다.

실험 결과

연구 질문

  • RQ1클래스 이질성은 다양한 기계학습 문제에 걸쳐 코어세트 복잡도를 통합 측정하는 데 사용될 수 있는가?
  • RQ2특히 가우시안 커널에 대해 $\epsilon$-근사화를 위한 최소 코어세트 크기는 얼마인가?
  • RQ3이질성 이론을 활용하여 스트리밍 스케치에 대한 머지-레드럭션 기법을 어떻게 향상시킬 수 있는가?
  • RQ4양의 준정부호 커널에 대해 낮은 이질성 수열을 생성하는 결정론적이고 효율적인 알고리즘이 존재하는가?
  • RQ5이질성 유계를 사용하여 VC 차원 또는 민감도 기반 방법에 의해 유도되는 것보다 더 날카로운 코어세트 크기 보장을 도출할 수 있는가?

주요 결과

  • 논문은 로지스틱 회귀, 시그모이드 손실, 행렬 공분산 및 커널 밀도 추정에 대해 $O(\sqrt{d}/\epsilon)$ 크기의 코어세트가 존재함을 증명한다.
  • 가우시안 커널 밀도 추정에 대해 논문은 차원에 관계없이 $O(1/\epsilon^2)$ 크기의 코어세트가 충분함을 보여주며, 오랜 동안 미해결이었던 문제를 해결한다.
  • 제안된 양의 준정부호 커널에 대한 결정론적 알고리즘은 $\max_q |\sum_i \sigma_i K(x_i, q)| \leq \sqrt{m}$ 를 달성하며, 이는 최악의 경우에서 최적이다.
  • 향상된 머지-레드럭션 기법은 메모리 복잡도를 $O(m^2)$ 에서 $O(m)$ 으로 감소시켜 효율적인 스트리밍 스케치를 가능하게 한다.
  • $L$-립시츠 커널에 대해, 랜덤화된 스트리밍 알고리즘은 높은 확률로 메모리 복잡도 $O(\log^3(d \log(RLn/\delta\epsilon))/\epsilon^2)$ 를 달성한다.
  • 이론적 유계는 VC 차원 또는 민감도 기반 방법에 의해 유도되는 것보다 많은 경우에서 이질성 기반 코어세트 크기가 훨씬 작다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.