Skip to main content
QUICK REVIEW

[논문 리뷰] Hyperparameter Tuning with Renyi Differential Privacy

Nicolas Papernot, Thomas Steinke|arXiv (Cornell University)|2021. 10. 07.
Privacy-Preserving Technologies in Data참고 문헌 26인용 수 6
한 줄 요약

이 논문은 반복적 모델 최적화 중 비밀유지 누출을 제한하기 위해 Rényi Differential Privacy (RDP)를 사용하는 차별적 비밀유지 하이퍼파rameter 튜닝 프레임워크를 제안한다. 무작위로 선택된 학습 런 수를 샘플링하고 최고의 모델을 선택함으로써, 이 방법은 런 수에 대해 로그 성장하는 비밀유지 보장을 달성한다—선형 조합 경계보다 크게 향상되었으며, 유틸리티를 희생시키지 않고도 비밀유지된 모델 선택을 가능하게 한다.

ABSTRACT

For many differentially private algorithms, such as the prominent noisy stochastic gradient descent (DP-SGD), the analysis needed to bound the privacy leakage of a single training run is well understood. However, few studies have reasoned about the privacy leakage resulting from the multiple training runs needed to fine tune the value of the training algorithm's hyperparameters. In this work, we first illustrate how simply setting hyperparameters based on non-private training runs can leak private information. Motivated by this observation, we then provide privacy guarantees for hyperparameter search procedures within the framework of Renyi Differential Privacy. Our results improve and extend the work of Liu and Talwar (STOC 2019). Our analysis supports our previous observation that tuning hyperparameters does indeed leak private information, but we prove that, under certain assumptions, this leakage is modest, as long as each candidate training run needed to select hyperparameters is itself differentially private.

연구 동기 및 목표

  • DP-SGD와 같은 차별적 비밀유지 학습 알고리즘을 사용할 때 하이퍼파rameter 튜닝에서 간과된 비밀유지 위험을 해결하기 위해.
  • 비밀유지되지 않은 튜닝 절차를 통해 하이퍼파라미터 선택이 개인 정보를 유출할 수 있는지를 공식적으로 정량화하기 위해.
  • Rényi Differential Privacy 기반으로 강력한 비밀유지 보장을 유지하는 비밀유지된 하이퍼파라미터 탐색 메커니즘을 개발하기 위해.
  • 이전 연구를 향상시켜 런 수에 따라 비밀유지 손실 경계가 선형이 아니라 로그 성장하도록 하기 위해.
  • 자르기된 무작위 반복 학습 런을 사용하여 차별적 비밀유지 모델 선택을 위한 실용적이고 분석적으로 타당한 방법을 제공하기 위해.

제안 방법

  • 비밀유지 누출을 제어하기 위해 잘라내기 임계값을 가진 분포에서 수를 무작위로 선택하는 방식으로 학습 런 수를 결정한다.
  • 전체 하이퍼파라미터 튜닝 과정의 비밀유지 손실을 분석하기 위해 Rényi Differential Privacy (RDP)를 적용하며, 전통적 DP보다 더 날카운 비밀유지 경계를 확보하기 위해 RDP 프레임워크를 활용한다.
  • 비밀유지 비용을 제어하기 위해 학습 런 수를 잘라내기 지점 m에 따라 조건화한다. 이는 고값의 평균 런 수가 작아지게 하여 비밀유지 비용을 통제한다.
  • 확률 생성 함수(PGFs)와 그 도함수를 사용하여 이웃 데이터셋 간의 비밀유지 손실을 비교하는 일반적인 비밀유지 경계를 유도한다.
  • 후처리 불변성과 Rényi 발산을 활용하여, 여러 비밀유지 런에서 최고의 모델을 선택할 때의 비밀유지 손실을 경계한다.
  • 비밀유지 경계를 더욱 날카롭게 만들 수 있도록, 분포의 尾행동에 따라 의존하는 잘라낸 분포를 도입한다.

실험 결과

연구 질문

  • RQ1비밀유지되지 않은 모델 평가에 기반한 하이퍼파라미터 튜닝은 훈련 데이터의 개인 정보를 누출시킬 수 있는가?
  • RQ2여러 개의 차별적 비밀유지 학습 런에서 최고의 모델을 선택할 때의 비밀유지 비용은 얼마인가?
  • RQ3학습 런 수에 따라 비밀유지 보장이 선형이 아닌 하위선형으로 성장할 수 있는가?
  • RQ4강력한 비밀유지를 유지하면서 유틸리티 손실을 최소화하는 하이퍼파라미터 튜닝 절차를 어떻게 설계할 수 있는가?
  • RQ5무작위 하이퍼파라미터 검색에서 비밀유지 파rameters와 학습 런 수의 꼬리 무게 간의 상호 교환 관계는 무엇인가?

주요 결과

  • 비밀유지되지 않은 학습 런에 기반한 하이퍼파라미터 튜닝은 훈련 데이터의 이질적인 샘플이 최적 하이퍼파라미터에 큰 영향을 미칠 경우 개인 정보를 누출시킬 수 있다.
  • 무작위로 선택된 학습 런 수를 사용할 경우, 여러 차별적 비밀유지 학습 런에서 최고의 모델을 선택할 때의 비밀유지 비용은 런 수에 대해 로그 성장한다—선형 성장이 아니라.
  • 기하 분포를 사용하고 충분히 작은 잘라내기 지점이면, 런 수에 독립적인 비밀유지 보장을 달성할 수 있다.
  • 큰 수의 런이 발생할 확률이 낮을 경우, 표준 조합 정리보다 정량적으로 더 날카운 비밀유지 경계를 확보한다.
  • 이 프레임워크는 약간의 DP로 완화하지 않고도 비밀유지된 하이퍼파라미터 튜닝을 가능하게 하여 더 강력한 비밀유지 보장을 유지한다.
  • 잘라내기 임계값을 초과하는 런의 기대 수가 작을 경우 이 유도된 경계가 효과적이며, 이는 충분히 큰 잘라내기 값에서 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.