Skip to main content
QUICK REVIEW

[논문 리뷰] Input Perturbation: A New Paradigm between Central and Local Differential Privacy

Yilin Kang, Yong Liu|arXiv (Cornell University)|2020. 02. 20.
Privacy-Preserving Technologies in Data참고 문헌 46인용 수 10
한 줄 요약

이 논문은 경험적 리스크 최소화에 대해 새로운 차별적 프라이버시 방법으로 입력 편향을 제안한다. 여기서는 가우시안 노이즈를 직접적으로 학습 데이터에 추가하여 데이터, 기울기, 최종 모델 파라미터를 동시에 보호한다. 이 방법은 모델에 대해 (ε, δ)-차별적 프라이버시를 확보하면서도 최신 중앙 집중형 방법들과 동등하거나 그 이상의 성능을 달성하며, 정확도를 희생시키지 않은 채 더 강력한 종단 간 프라이버시 보장을 제공한다.

ABSTRACT

Traditionally, there are two models on differential privacy: the central model and the local model. The central model focuses on the machine learning model and the local model focuses on the training data. In this paper, we study the extit{input perturbation} method in differentially private empirical risk minimization (DP-ERM), preserving privacy of the central model. By adding noise to the original training data and training with the `perturbed data', we achieve ($ε$,$δ$)-differential privacy on the final model, along with some kind of privacy on the original data. We observe that there is an interesting connection between the local model and the central model: the perturbation on the original data causes the perturbation on the gradient, and finally the model parameters. This observation means that our method builds a bridge between local and central model, protecting the data, the gradient and the model simultaneously, which is more superior than previous central methods. Detailed theoretical analysis and experiments show that our method achieves almost the same (or even better) performance as some of the best previous central methods with more protections on privacy, which is an attractive result. Moreover, we extend our method to a more general case: the loss function satisfies the Polyak-Lojasiewicz condition, which is more general than strong convexity, the constraint on the loss function in most previous work.

연구 동기 및 목표

  • 기존 중앙 집중형 차별적 프라이버시에서 원본 데이터는 보호되지 않지만 모델 수준의 프라이버시만 확보되는 프라이버시 격차를 해소하기 위해.
  • 입력 노이즈가 기울기를 통해 최종 모델로 전파됨을 보여줌으로써 국지적 및 중앙 집중형 차별적 프라이버시 간 격차를 메우기 위해.
  • 모든 단계인 데이터, 기울기, 모델 파라미터에서 프라이버시를 유지하는 일반 목적의 최적화 방법에 독립적인 방법을 개발하기 위해.
  • 강한 볼록 손실 함수를 초월해 더 일반적인 폴리악-로자예프스키 조건을 만족하는 손실 함수로 방법을 확장하기 위해.
  • 기존 중앙 집중형 방법들과 비교했을 때 성능이 유사하거나 뛰어나면서도 더 강력한 프라이버시 보장을 제공함을 경험적으로 검증하기 위해.

제안 방법

  • 모델 학습 전에 각 원본 학습 데이터 포인트에 평균 0인 가우시안 노이즈를 추가하여 입력 수준의 프라이버시를 확보한다.
  • 입력 노이즈가 최적화 과정을 통해 전파됨을 활용: 데이터의 노이즈가 기울기와 최종 모델 파라미터의 노이즈를 유도한다.
  • 기울기와 모델 업데이트의 민감도로부터 유도된 최종 모델에 대한 (ε, δ)-차별적 프라이버시 보장을 수식적으로 정의한다.
  • 이론적 분석을 통해 입력 편향이 기울기 및 파라미터 편향을 통해 모델에 대해 차별적 프라이버시를 유도함을 보이며, 국지적 및 중앙 집중형 모델 간의 프라이버시 다리를 구축한다.
  • 강한 볼록성보다 약한 조건이지만 더 널리 적용 가능한 폴리악-로자예프스키(PL) 조건을 만족하는 손실 함수로 프레임워크를 확장한다.
  • 하이퍼파라미터 T와 α를 교차 검증을 통해 튜닝하고, 실제 데이터셋에서 로지스틱 회귀 및 MLP 모델에 대해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1입력 편향이 원본 데이터의 프라이버시를 유지하면서도 최종 모델에 대해 (ε, δ)-차별적 프라이버시를 제공할 수 있는가?
  • RQ2기존 중앙 집중형 방법들과 비교했을 때 입력 편향은 기울기 및 모델 파라미터 분포에 어떤 영향을 미치는가?
  • RQ3기존 중앙 집중형 DP-ERM 방법들인 기울기 편향 및 출력 편향과 비교해 입력 편향이 동등하거나 더 나은 성능을 달성하는가?
  • RQ4입력 편향 방법은 강한 볼록 손실 함수가 아닌, 폴리악-로자예프스키 조건을 만족하는 비강한 볼록 손실 함수로도 확장 가능한가?
  • RQ5다양한 데이터셋과 모델에서 프라이버시 예산 ε과 모델 정확도 사이의 경험적 트레이드오프는 어떠한가?

주요 결과

  • 제안된 입력 편향 방법은 정확도와 최적성 갭 측면에서 기울기 편향(Bassily 등, 2014) 및 출력 편향(Wang 등, 2017)과 같은 최신 중앙 집중형 방법들과 유사하거나 그 이상의 성능을 달성한다.
  • 대부분의 데이터셋에서 이 방법의 정확도는 비프라이버시 ERM 기준선과 거의 동일하여 성능 저하가 거의 없음을 시사한다.
  • 제안된 방법의 최적성 갭은 Bassily 등(2014) 및 Kifer 등(2012)보다 일관되게 낮으며, 특히 더 날카운 노이즈 한계 덕분이다.
  • 이 방법은 데이터셋 간에 안정적인 성능을 보이며, 정확도와 최적성 갭의 변동이 미미하다. 반면 Bassily 등(2014)의 기울기 편향 방법은 느슨한 노이즈 한계로 인해 급격한 성능 저하를 보이는데 비해 이는 그렇지 않다.
  • 작은 데이터셋(크기 < 1000)에서도 이 방법은 강력한 성능을 유지하여, 저자료 환경에서도 효과적임을 확인한다.
  • 이 방법은 종단 간 프라이버시 보호를 제공한다: 원본 데이터, 기울기, 최종 모델이 모두 편향되며, 기존 중앙 집중형 모델보다 더 강력한 프라이버시 보장을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.