[논문 리뷰] Locally Private Learning without Interaction Requires Separation
이 논문은 분포독립적 PAC 클래스에 대한 비상호작용적 국소적 차별적 프라이버시 학습이, 클래스의 마진 복잡도가 다항적으로 작은 경우를 제외하고는 지수적 표본 복잡도를 요구한다는 것을 입증한다. 선형 분리자와 결정 목록과 같은 자연스럽게 발생하는 마진 복잡도가 낮은 클래스들 역시 비상호작용적으로 학습하기 위해 여전히 지수적으로 많은 표본이 필요함을 보여, 자연스러운 문제에 대해 상호작용과 비상호작용 LDP 학습 간의 첫 번째 지수적 분리 결과를 확립한다.
We consider learning under the constraint of local differential privacy (LDP). For many learning problems known efficient algorithms in this model require many rounds of communication between the server and the clients holding the data points. Yet multi-round protocols are prohibitively slow in practice due to network latency and, as a result, currently deployed large-scale systems are limited to a single round. Despite significant research interest, very little is known about which learning problems can be solved by such non-interactive systems. The only lower bound we are aware of is for PAC learning an artificial class of functions with respect to a uniform distribution (Kasiviswanathan et al. 2011). We show that the margin complexity of a class of Boolean functions is a lower bound on the complexity of any non-interactive LDP algorithm for distribution-independent PAC learning of the class. In particular, the classes of linear separators and decision lists require exponential number of samples to learn non-interactively even though they can be learned in polynomial time by an interactive LDP algorithm. This gives the first example of a natural problem that is significantly harder to solve without interaction and also resolves an open problem of Kasiviswanathan et al. (2011). We complement this lower bound with a new efficient learning algorithm whose complexity is polynomial in the margin complexity of the class. Our algorithm is non-interactive on labeled samples but still needs interactive access to unlabeled samples. All of our results also apply to the statistical query model and any model in which the number of bits communicated about each data point is constrained.
연구 동기 및 목표
- 비상호작용적 국소적 차별적 프라이버시 학습(LDP)이 분포독립적 PAC 학습에 대해 가지는 근본적 한계를 규명하는 것.
- 이전 연구가 균일 분포 하에서 인위적이고 비자연스러운 함수 클래스에 대해서만 지수적 하한을 제시한 점을 보완하여 격차를 메우는 것.
- 마진 복잡도와 비상호작용적 LDP 학습의 표본 복잡도 사이의 밀접한 연결 고리를 확립하는 것.
- [KLNRS11]에서 제기한 열린 문제를 해결하기 위해, 선형 분리자와 결정 목록과 같은 자연스러운 클래스들이 비상호작용적으로 학습하기 위해 지수적으로 더 어려운지 보여주는 것.
- 하한 결과를 통계쿼리(SQ) 모델과 유사한 모델들, 예를 들어 유한 통신량 프로토콜로 확장하는 것.
제안 방법
- 부울 함수 클래스의 핵심 복잡도 척도로 마진 복잡도를 도입하며, 이는 선형 임bedding을 통한 최대 마진의 역수로 정의된다.
- 분포독립적 PAC 학습에 대한 모든 비상호작용적 LDP 알고리즘은 해당 클래스의 마진 복잡도에 대해 지수적 표본 복잡도를 요구해야 한다는 것을 증명한다.
- 통계쿼리(SQ) 모델로의 감소를 통해 비상호작용적 LDP 알고리즘이 비적응형 SQ 알고리즘에 의해 시뮬레이션 가능하다는 것을 보여준다.
- 통신 복잡도 이론과 학습 이론에서의 기존 결과를 활용하여, 마진 복잡도 척도에 대한 알려진 SQ 하한을 적용한다.
- 마진 복잡도에 대해 다항식 표본 복잡도를 가지는 새로운 비상호작용적 LDP 학습 알고리즘을 구성함으로써, 하한의 날카로움을 입증한다.
- 결과를 유한 통신량 모델으로 확장하여, 각 표본이 최대 ℓ 비트로만 전송될 경우에도 동일한 하한이 적용됨을 보여준다.
실험 결과
연구 질문
- RQ1비상호작용적 LDP 알고리즘이 분포독립적 PAC 설정에서 자연스러운 클래스, 예를 들어 선형 분리자와 결정 목록을 효율적으로 학습할 수 있는가?
- RQ2마진 복잡도가 비상호작용 학습에서 LDP 및 관련 모델의 근본적 장벽인가?
- RQ3상호작용이 없는 경우 LDP 모델에서 자연스러운 학습 문제에 대해 지수적 표본 복잡도 격차가 발생하는가?
- RQ4클래스의 마진 복잡도를 사용하여 LDP 및 SQ 모델에서 비상호작용 학습의 표본 복잡도를 특성화할 수 있는가?
- RQ5특히 반공간 클래스와 같은 경우에, 라운드 수와 표본 복잡도 사이의 상호 교환 관계는 무엇인가?
주요 결과
- 부울 함수 클래스의 마진 복잡도는 분포독립적 PAC 학습에 대한 모든 비상호작용적 LDP 알고리즘의 표본 복잡도에 하한을 제공한다.
- 마진 복잡도가 다항적으로 유계인 선형 분리자와 결정 목록은 LDP 모델에서 비상호작용적으로 학습하기 위해 여전히 지수적으로 많은 표본이 필요하다.
- 이는 자연스러운 학습 문제에 대해 상호작용과 비상호작용 LDP 프로토콜 간의 첫 번째 지수적 분리를 확립한다.
- 하한 결과는 통계쿼리(SQ) 모델과, 각 데이터 포인트가 최대 ℓ 비트로 전송되는 유한 통신량 모델로도 확장된다.
- 마진 복잡도에 대해 다항식 표본 복잡도를 가지는 새로운 비상호작용적 LDP 학습 알고리즘을 구성함으로써, 하한의 날카로움을 입증한다.
- 결과적으로, 어떤 클래스 C에 대해 레이블 비적응형 ℓ-통신량 제한 알고리즘으로 PAC 학습을 수행하려면 최소 Ω(MC(C)^{2/3}/2^ℓ)개의 표본이 필요하며, 여기서 MC(C)는 C의 마진 복잡도이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.