Skip to main content
QUICK REVIEW

[논문 리뷰] On-Average KL-Privacy and its equivalence to Generalization for Max-Entropy Mechanisms

Yu-Xiang Wang, Jing Lei|arXiv (Cornell University)|2016. 05. 08.
Privacy-Preserving Technologies in Data참고 문헌 21인용 수 17
한 줄 요약

이 논문은 일반화와 동치인 약화된 개인정보 보호 개념인 On-Average KL-Privacy를 소개한다. 이는 최대 엔트로피 기반 메커니즘—exp(−ℒ(output, data))π(output) 비례 분포—에서 성립한다. 이 광범위한 알고리즘 클래스(베이지안 추론 및 경험 리스크 최소화 포함)에 대해 On-Average KL-Privacy가 일반화 오차를 특징짓는다는 것을 입증하며, 기존의 차별적 개인정보 보호보다 유용성의 우월한 트레이드오프를 제공하는 정보이론적 연결을 제안한다.

ABSTRACT

We define On-Average KL-Privacy and present its properties and connections to differential privacy, generalization and information-theoretic quantities including max-information and mutual information. The new definition significantly weakens differential privacy, while preserving its minimalistic design features such as composition over small group and multiple queries as well as closeness to post-processing. Moreover, we show that On-Average KL-Privacy is **equivalent** to generalization for a large class of commonly-used tools in statistics and machine learning that samples from Gibbs distributions---a class of distributions that arises naturally from the maximum entropy principle. In addition, a byproduct of our analysis yields a lower bound for generalization error in terms of mutual information which reveals an interesting interplay with known upper bounds that use the same quantity.

연구 동기 및 목표

  • 강력한 차별적 개인정보 보호와 실용적 유용성 사이의 격차를 메우기 위해 일반화를 보장하는 동시에 더 약한 개인정보 보호 개념을 제안하는 것.
  • 손실 함수와 사전 분포를 갖는 지브스 분포에서 샘플링하는 광범위한 통계 및 기계학습 알고리즘에 대해 개인정보 보호와 일반화 사이의 관계를 체계화하는 것.
  • On-Average KL-Privacy가 최대 엔트로피 기반 메커니즘에서 일반화에 대해 必要하고 충분한 조건임을 입증하는 것.
  • 차별적 개인정보 보호를 약화시키면서도 복합성과 후처리 불변성과 같은 핵심 성질을 유지하는 프레임워크를 제공하는 것.
  • 기존의 상한값과 보완되는 상한값으로서, 상호정보량을 활용한 일반화 오차에 대한 새로운 하한값을 밝혀내는 것.

제안 방법

  • 이웃 데이터셋에서의 출력 분포 간의 기대 KL 발산으로 정의된 차별적 개인정보 보호의 완화된 형태인 On-Average KL-Privacy를 제안한다.
  • 베이지안 추론 및 ERM에서 흔한 형태인 p(h|Z) ∝ exp(−ℒ(h,Z))π(h)의 최대 엔트로피 분포에서 샘플링하는 알고리즘을 분석한다.
  • 상호정보량 I(𝒜(Z);Z) 및 최대 정보량 I∞(𝒜,n)과 같은 정보이론적 도구를 사용하여 개인정보 보호와 일반화를 특징짓는다.
  • 순차적 질의에 대해 On-Average KL-Privacy의 경계를 유도하기 위해 적응형 복합 정리(adaptive composition theorems)를 적용한다.
  • 제이슨의 부등식과 데이터 편향에 대한 기대값을 활용하여 On-Average KL-Privacy와 일반화 오차를 연결한다.
  • 상호정보량을 사용하여 일반화 오차의 하한값을 유도하며, 동일한 양의 상한값과 대비한다.

실험 결과

연구 질문

  • RQ1강력한 개인정보 보호 개념이 아닌 약한 개인정보 보호 개념이 광범위한 학습 알고리즘 클래스에서 일반화와 등가가 될 수 있는가?
  • RQ2On-Average KL-Privacy는 최대 엔트로피 기반 메커니즘에서 차별적 개인정보 보호와 일반화와 어떻게 관련이 있는가?
  • RQ3상호정보량은 사후 샘플링 알고리즘의 일반화 오차를 특징짓는 데 어떤 역할을 하는가?
  • RQ4On-Average KL-Privacy는 다중 질의에 걸쳐 적응형 복합성을 유지하면서도 개인정보 보장을 유지할 수 있는가?
  • RQ5최대 엔트로피 샘플링의 맥락에서 상호정보량과 일반화 오차 사이의 상호작용은 어떠한가?

주요 결과

  • On-Average KL-Privacy는 베이지안 추론 및 경험 리스크 최소화를 포함한 모든 최대 엔트로피 기반 메커니즘에서 일반화와 등가이다.
  • 논문은 상호정보량을 활용한 일반화 오차에 대한 하한값을 확립하며, 상호정보량이 상한값과 하한값 모두에서 이중적인 역할을 한다는 점을 드러낸다.
  • On-Average KL-Privacy는 복합성과 후처리 불변성과 같은 차별적 개인정보 보호의 핵심 성질을 그대로 이어받는다.
  • On-Average KL-Privacy와 일반화의 등가는 손실 함수와 사전 분포를 갖는 지브스 분포에서 샘플링하는 알고리즘에 대해 특별히 성립한다.
  • 적응형 복합 결과에 따르면 On-Average KL-Privacy는 순차적 질의에서도 유지되며, 질의 수에 비례하여 선형적으로 증가하는 경계를 갖는다.
  • 분석 결과, 이웃 데이터셋에서의 사후 분포 간 기대 KL 발산이 최대 엔트로피 기반 메커니즘의 일반화 오차를 특징짓는다는 것이 드러났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.