Skip to main content
QUICK REVIEW

[논문 리뷰] Unleashing the Power of Randomization in Auditing Differentially Private ML

Krishna Pillutla, Galen Andrew|arXiv (Cornell University)|2023. 05. 29.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 무작위 캐니발과 교환 가능 테스트 통계량을 활용하여 표본 효율성을 최대 16배 향상시키는 차별적 개인 정보 보호 기계 학습을 위한 새로운 감사 프레임워크를 제안한다. 리프티드 차별적 개인 정보 보호(LiDP)와 경험적 상관관계를 활용하는 적응형 신뢰구간을 제안함으로써, 각 개인 정보 보호 모델을 여러 가설 검정에 재사용함으로써 개인 정보 보호 보증을 감사하기 위해 필요한 모델 재학습 횟수를 크게 감소시킨다.

ABSTRACT

We present a rigorous methodology for auditing differentially private machine learning algorithms by adding multiple carefully designed examples called canaries. We take a first principles approach based on three key components. First, we introduce Lifted Differential Privacy (LiDP) that expands the definition of differential privacy to handle randomized datasets. This gives us the freedom to design randomized canaries. Second, we audit LiDP by trying to distinguish between the model trained with $K$ canaries versus $K - 1$ canaries in the dataset, leaving one canary out. By drawing the canaries i.i.d., LiDP can leverage the symmetry in the design and reuse each privately trained model to run multiple statistical tests, one for each canary. Third, we introduce novel confidence intervals that take advantage of the multiple test statistics by adapting to the empirical higher-order correlations. Together, this new recipe demonstrates significant improvements in sample complexity, both theoretically and empirically, using synthetic and real data. Further, recent advances in designing stronger canaries can be readily incorporated into the new framework.

연구 동기 및 목표

  • 표본 수천 개의 모델 재학습이 필요한 차별적 개인 정보 보호 기계 학습 모델 감사의 높은 계산 비용을 해결하기 위해.
  • 독립적인 베르누이 시행에 기반한 표준 감사 방법의 기본적인 $1/\sqrt{n}$ 표본 복잡도 한계를 극복하기 위해.
  • 대칭성과 무작위화를 통해 개인 정보 보호 모델을 여러 가설 검정에 효율적으로 재사용할 수 있는 원칙적인 프레임워크를 개발하기 위해.
  • 테스트 통계량 간 경험적 고차 상관관계를 고려하는 적응형 신뢰구간을 설계하여 통계적 검정력을 향상시키기 위해.
  • 고급 캐니발 설계를 더 효율적인 감사 파이프라인에 원활하게 통합할 수 있도록 하기 위해.

제안 방법

  • 무작위 데이터셋과 기각 집합을 允허하는 DP의 확장 정의인 리프티드 차별적 개인 정보 보호(LiDP)를 도입하여, 무작위 캐니발의 사용을 가능하게 한다.
  • 학습 세트에 $K > 1$개의 i.i.d. 무작위 캐니발을 추가하고, $K$개의 캐니발을 사용해 학습한 모델와 $K-1$개의 캐니발을 사용해 학습한 모델를 비교하는 감사 프로토콜을 설계한다.
  • i.i.d. 캐니발에 의해 유도되는 테스트 통계량의 교환 가능성 특성을 활용하여, 각 개인 정보 보호 모델을 $K$개의 서로 다른 가설 검정에 재사용함으로써 $K$번의 별도 재학습을 피한다.
  • 교환 가능한 베르누이 랜덤 변수를 위한 새로운 적응형 신뢰구간 가족을 제안하여 경험적 고차 상관관계를 고려함으로써 표준 구간보다 정밀도를 향상시킨다.
  • 테스트 통계량을 모델링하기 위해 eXchangeable Bernoulli(XBern) 분포를 사용하고, 독립 또는 i.i.d. 가정보다 더 날카운 구간을 유도한다.
  • 최신 캐니발 설계(예: 데이터 풀링 및 무작위 기울기 캐니발)를 새로운 프레임워크에 통합하여 탐지 감도를 향상시킨다.

실험 결과

연구 질문

  • RQ1차별적 개인 정보 보호 기계 학습 모델 감사에서 $1/\sqrt{n}$ 표본 복잡도 장벽을 깨뜨릴 수 있는가?
  • RQ2각 개인 정보 보호 모델을 여러 가설 검정에 재사용하면서 통계적 타당성을 손상시키지 않는 감사 프레임워크를 어떻게 설계할 수 있는가?
  • RQ3테스트 통계량 간 경험적 고차 상관관계가 개인 정보 보호 감사의 정밀도에 어떤 영향을 미치는가?
  • RQ4표준 캐니발 기반 감사 접근법을 확장하여, 효율성을 유지하거나 향상시키면서도 무작위로 선택된 i.i.d. 캐니발을 사용할 수 있는가?
  • RQ5경험적 상관관계를 기반으로 한 적응형 신뢰구간은 표준 구간에 비해 표본 효율성과 정확도 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 이론적·실증적으로 합성 및 실제 데이터셋에서 표준 감사 대비 표본 복잡도를 최대 16배 향상시킨다.
  • i.i.d. 무작위 캐니발의 사용은 테스트 통계량의 교환 가능성 특성을 유도하여, 각 개인 정보 보호 모델을 $K$개의 서로 다른 가설 검정에 재사용할 수 있게 한다.
  • 경험적 고차 상관관계를 고려하는 적응형 신뢰구간은 실제 상관관계가 낮을수록 표준 구간보다 훨씬 좁은 구간을 제공함으로써 정밀도를 크게 향상시킨다.
  • 이 프레임워크는 데이터 풀링 및 무작위 기울기 캐니발과 같은 고급 캐니발 설계를 원활하게 통합할 수 있어 탐지 감도를 향상시킨다.
  • 실증 결과는 다수의 캐니발을 추가하더라도 모델 테스트 정확도가 저하되지 않음을 확인하여, 감사 과정이 비침습적임을 입증한다.
  • 2차 Wilson 구간이 모든 테스트된 $ε$ 값에서 성능이 뛰어나고 구현이 용이하여 기본 구간으로 추천되며, 4차 버전보다 뛰어나거나 동등한 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.