Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Coverage Functions and Private Release of Marginals

Vitaly Feldman, Pravesh K. Kothari|arXiv (Cornell University)|2013. 04. 08.
Machine Learning and Algorithms참고 문헌 54인용 수 5
한 줄 요약

이 논문은 PMAC 모델에서 커버리지 함수를 학습하기 위한 최초의 완전 다항식 알고리즘을 제시하며, 입력의 $1-\delta$ 비율에서 $1+\gamma$ 요인 내의 곱셈적 근사치를 시간 $\mathsf{poly}(n,1/\gamma,1/\delta)$ 내에 달성한다. 또한 이 학습 프레임워크를 활용해 평균 오차가 낮은 $k$-방향 마진털을 비밀리에 공개할 수 있도록 한다.

ABSTRACT

We study the problem of approximating and learning coverage functions. A function $c: 2^{[n]} ightarrow \mathbf{R}^{+}$ is a coverage function, if there exists a universe $U$ with non-negative weights $w(u)$ for each $u \in U$ and subsets $A_1, A_2, \ldots, A_n$ of $U$ such that $c(S) = \sum_{u \in \cup_{i \in S} A_i} w(u)$. Alternatively, coverage functions can be described as non-negative linear combinations of monotone disjunctions. They are a natural subclass of submodular functions and arise in a number of applications. We give an algorithm that for any $γ,δ>0$, given random and uniform examples of an unknown coverage function $c$, finds a function $h$ that approximates $c$ within factor $1+γ$ on all but $δ$-fraction of the points in time $poly(n,1/γ,1/δ)$. This is the first fully-polynomial algorithm for learning an interesting class of functions in the demanding PMAC model of Balcan and Harvey (2011). Our algorithms are based on several new structural properties of coverage functions. Using the results in (Feldman and Kothari, 2014), we also show that coverage functions are learnable agnostically with excess $\ell_1$-error $ε$ over all product and symmetric distributions in time $n^{\log(1/ε)}$. In contrast, we show that, without assumptions on the distribution, learning coverage functions is at least as hard as learning polynomial-size disjoint DNF formulas, a class of functions for which the best known algorithm runs in time $2^{ ilde{O}(n^{1/3})}$ (Klivans and Servedio, 2004). As an application of our learning results, we give simple differentially-private algorithms for releasing monotone conjunction counting queries with low average error. In particular, for any $k \leq n$, we obtain private release of $k$-way marginals with average error $\barα$ in time $n^{O(\log(1/\barα))}$.

연구 동기 및 목표

  • PMAC 모델에서 목표 함수를 대부분의 입력에서 곱셈적으로 근사하는 데 효율적인 학습 알고리즘을 개발하는 것.
  • PMAC 모델에서 비트리비얼한 부분모듈라 함수 클래스에 대해 처음으로 다항식 시간 학습 알고리즘을 확립하는 것.
  • 학습된 커버리지 함수를 활용해 단조성 연산 카운팅 쿼리에 대해 저평균 오차로 비밀리에 공개할 수 있도록 하는 것.
  • 균일, 곱, 대칭 분포를 포함한 다양한 분포 하에서 커버리지 함수의 학습 가능성 탐구.
  • 분포 독립적 학습의 계산 복잡도를 다항식 크기의 분리된 DNF 공식을 학습하는 어려운 문제와 연결하여 명확히 하는 것.

제안 방법

  • 커버리지 함수를 단조성 논리합의 음이 아닌 선형 조합으로 나타내는 새로운 구조적 특성화를 활용한다.
  • 각 임계값 함수를 단조성 논리합 학습으로의 환원을 통해 학습하는 임계값 기반 근사 기법을 적용한다.
  • 다항식 회귀와 변수 식별 기법을 사용해 커버리지 함수 분해에서 단조성 논리합의 계수를 추정한다.
  • 강화 스타일 환원을 적용: 목표 함수의 임계값 함수를 학습하고 이를 조합하여 원래 함수를 $\ell_1$ 오차 제어로 재구성한다.
  • $\ell_1$ 오차 학습을 위한 커버리지 함수 학습 문제를 음이 아닌 단조성 논리합의 합의 임계값 함수 학습 문제로 환원한다.
  • 파rameterized 임계값 기반 메커니즘을 활용해 근사 오차를 제한하고, 최종 가설이 목표 함수의 $\ell_1$ 오차를 $\epsilon$ 이내로 유지하도록 보장한다.

실험 결과

연구 질문

  • RQ1분포 가정 없이 PMAC 모델에서 커버리지 함수를 효율적으로 학습할 수 있는가?
  • RQ2일반 분포 하에서 커버리지 함수 학습의 계산 복잡도는 무엇이며, 분리된 DNF 공식과 같은 알려진 어려운 클래스와의 관계는 어떠한가?
  • RQ3이 학습 프레임워크를 확장하여 평균 오차가 낮은 $k$-방향 마진털을 비밀리에 공개할 수 있는가?
  • RQ4제품 분포와 대칭 분포에서 커버리지 함수에 대해 효율적인 $\ell_1$ 오차 학습이 가능한가?
  • RQ5커버리지 함수의 어떤 구조적 특성이 PMAC 및 $\ell_1$ 오차 모델에서의 효율적 학습 가능성을 가능하게 하는가?

주요 결과

  • 논문은 PMAC 모델에서 커버리지 함수를 학습하기 위한 최초의 완전 다항식 알고리즘을 제시하며, 입력의 $1-\delta$ 비율에서 $1+\gamma$ 곱셈적 근사치를 달성하기 위해 시간 $\mathsf{poly}(n,1/\gamma,1/\delta)$ 내에 수행된다.
  • 제품 및 대칭 분포 하에서 커버리지 함수의 $\ell_1$ 오차 학습이 초과 오차 $\epsilon$ 에 대해 시간 $n^{\log(1/\epsilon)}$ 내에 달성될 수 있음을 입증한다.
  • 분포 독립적 학습에서 커버리지 함수 학습은 다항식 크기의 분리된 DNF 공식 학습 문제만큼 어렵다. 이 클래스에 대해 알려진 최고의 알고리즘은 시간 $2^{\tilde{O}(n^{1/3})}$ 내에 수행된다.
  • 이 프레임워크를 통해 평균 오차 $\bar{\alpha}$ 를 가진 $k$-방향 마진털을 비밀리에 공개할 수 있으며, 이는 시간 $n^{O(\log(1/\bar{\alpha}))}$ 내에 수행된다.
  • 임의의 고정된 분포에서 커버리지 함수의 $\ell_1$ 오차 학습 문제를 음이 아닌 단조성 논리합의 합의 임계값 함수 학습 문제로 환원하는 환원 관계를 확립한다.
  • 임계값 근사와 임계값 처리 과정에서의 오차 전파를 제어함으로써, 알고리즘이 $\mathop{\mathbf{E}}[|y - c^*(x)|] + 3\epsilon$ 이내의 $\ell_1$ 오차를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.