Skip to main content
QUICK REVIEW

[논문 리뷰] Differentially Private Empirical Risk Minimization with Input Perturbation

Kazuto Fukuchi, Quang Khai Tran|arXiv (Cornell University)|2017. 10. 20.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 차별적 개인 정보 보호를 위한 경험적 리스크 최소화(DP-ERM)를 위한 새로운 입력 편향 프레임워크를 제안한다. 각 데이터 기여자가 제출하기 전에 자신의 데이터를 국지적으로 무작위화함으로써, 국지적 차별적 개인 정보 보호(LDP)와 모델 수준의 차별적 개인 정보 보호(DP)를 모두 보장한다. 이 방법은 부과 위험 한계를 $O(1/n)$로 달성하여 부드러운 손실 조건 하에서 최신 기술 수준의 성능을 재현한다.

ABSTRACT

We propose a novel framework for the differentially private ERM, input perturbation. Existing differentially private ERM implicitly assumed that the data contributors submit their private data to a database expecting that the database invokes a differentially private mechanism for publication of the learned model. In input perturbation, each data contributor independently randomizes her/his data by itself and submits the perturbed data to the database. We show that the input perturbation framework theoretically guarantees that the model learned with the randomized data eventually satisfies differential privacy with the prescribed privacy parameters. At the same time, input perturbation guarantees that local differential privacy is guaranteed to the server. We also show that the excess risk bound of the model learned with input perturbation is $O(1/n)$ under a certain condition, where $n$ is the sample size. This is the same as the excess risk bound of the state-of-the-art.

연구 동기 및 목표

  • 데이터 수집 과정에서의 개인 정보 보호 보장을 빈도로 보완하기 위해 국지적 차별적 개인 정보 보호(LDP)를 추가로 보장하는 것.
  • 중앙 집중식 데이터 수집에 의존하는 대신, 데이터 기여자가 자신의 데이터를 국소적으로 편향시키는 프레임워크를 개발하는 것.
  • 학습된 모델이 $(\alpha\epsilon,\delta)$-DP를 만족함을 이론적으로 보장하면서도, 데이터 기여자의 개인정보는 $(\beta\sqrt{\epsilon},\delta)$-LDP를 통해 보호되도록 보장하는 것.
  • 특히 부드러운 손실 조건 하에서 $O(1/n)$의 부과 위험 한계를 달성함으로써 최신 기술 수준의 DP-ERM 방법과 유사한 유효성을 확보하는 것.

제안 방법

  • 각 데이터 기여자가 평균이 0인 가우시안 노이즈를 사용하여 입력 데이터를 독립적으로 편향시키며, 이는 국지적 차별적 개인 정보 보호를 보장한다.
  • 편향된 데이터는 중앙 서버에 제출되며, 서버는 노이즈가 섞인 입력 데이터를 기반으로 표준 ERM을 수행하여 모델을 학습한다.
  • 이 프레임워크는 가우시안 메커니즘을 활용하여 개인 정보 보장을 유도하며, 적절한 노이즈 스케일링 하에 모델 출력이 $(\alpha\epsilon,\delta)$-DP를 만족함을 보장한다.
  • 이론적 분석을 통해 이 편향 메커니즘이 데이터 기여자 수준의 국지적 개인 정보 보장과 모델 수준의 전역적 개인 정보 보장 모두를 보장함을 입증한다.
  • 직교 변환과 가우시안 랜덤 변수의 尾확률 한계를 활용하여 개인 정보 보장 파라미터를 유도한다.
  • 개인 정보 보장 파라미터 $\alpha$, $\beta$와 표본 크기 $n$ 사이의 상호 관계를 분석하며, $O(\sqrt{\alpha n}) = \beta$라는 관계를 설정한다.

실험 결과

연구 질문

  • RQ1데이터 기여자가 입력을 국소적으로 무작위화하는 방식으로, 국지적 개인 정보 보호와 모델 수준의 차별적 개인 정보 보호를 모두 확보할 수 있는 DP-ERM 프레임워크를 설계할 수 있는가?
  • RQ2중앙 집중식 DP-ERM 방법과 비교했을 때, 입력 편향의 유효성 손실(부과 위험)은 어떻게 되는가?
  • RQ3노이즈 분산 $\sigma^2$의 선택이 입력 편향 프레임워크에서 개인 정보 보호와 모델 유효성의 균형에 어떻게 영향을 주는가?
  • RQ4입력 편향 하에서 학습된 모델의 부과 위험은 최신 기술 수준의 DP-ERM 방법과 동일한 渐近적 비율을 달성할 수 있는가?
  • RQ5입력 편향 모델에서 국지적 개인 정보 보장 파라미터 $\beta$와 전역적 개인 정보 보장 파라미터 $\alpha$ 사이의 관계는 무엇인가?

주요 결과

  • 입력 편향 프레임워크는 최종 모델이 $(\alpha\epsilon,\delta)$-차별적 개인 정보 보장을 만족함을 보장하며, $\alpha$는 전역적 개인 정보 보장 예산을 조절한다.
  • 각 데이터 기여자에 대해 $(\beta\sqrt{\epsilon},\delta)$-LDP를 통해 국지적 차별적 개인 정보 보장이 보장되며, $\beta$는 개인 정보 보장 파라미터의 제곱근에 비례한다.
  • 입력 편향을 사용해 학습된 모델의 부과 위험은 $O\left(\frac{\eta\zeta\sqrt{d\log(1/\delta)}}{\epsilon\alpha n}\right)$이며, 이는 부드러운 손실 조건 하에서 최신 기술 수준과 일치한다.
  • 모델의 부과 위험 비율이 $O(1/n)$임을 보장하며, 이는 $\lambda$-부드러운 이차 손실 조건 하에서 최신 기술 수준의 DP-ERM 방법과 동일한 성능을 달성한다.
  • 이론적 분석을 통해 가우시안 노이즈의 꼬리 확률 한계와 직교 변환 기법을 통해 개인 정보 보장이 성립함을 확인한다.
  • 국지적 개인 정보 보장과 전역적 개인 정보 보장 간의 근본적인 상호 보완 관계를 제공하며, $O(\sqrt{\alpha n}) = \beta$라는 관계를 통해 확장 가능하고 개인 정보 보장이 보장된 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.