Skip to main content
QUICK REVIEW

[논문 리뷰] On Differentially Private Stochastic Convex Optimization with Heavy-tailed Data

Di Wang, Hanshen Xiao|arXiv (Cornell University)|2020. 10. 21.
Stochastic Gradient Optimization Techniques인용 수 11
한 줄 요약

이 논문은 표준 가정인 유계 기울기 또는 리프시츠 손실 함수가 실패하는 무거운 尾를 가진 데이터에 대해 차별적(private) 확률적 볼록 최적화(DP-SCO) 알고리즘을 제안한다. 이는 유계 기울기의 두 번째 모멘트 조건만을 요구하는, 기울기 자르기와 스무딩 프레임워크를 도입하여, 강력한 볼록성에 대해 $ frac{d^2}{n ilde{ heta}^2}$, 일반 볼록 손실에 대해 $ frac{d^{2/3}}{(n ilde{ heta}^2)^{1/3}}$의 초과 인구 위험 경계를 고확률적으로 달성한다.

ABSTRACT

In this paper, we consider the problem of designing Differentially Private (DP) algorithms for Stochastic Convex Optimization (SCO) on heavy-tailed data. The irregularity of such data violates some key assumptions used in almost all existing DP-SCO and DP-ERM methods, resulting in failure to provide the DP guarantees. To better understand this type of challenges, we provide in this paper a comprehensive study of DP-SCO under various settings. First, we consider the case where the loss function is strongly convex and smooth. For this case, we propose a method based on the sample-and-aggregate framework, which has an excess population risk of $ ilde{O}(\frac{d^3}{nε^4})$ (after omitting other factors), where $n$ is the sample size and $d$ is the dimensionality of the data. Then, we show that with some additional assumptions on the loss functions, it is possible to reduce the extit{expected} excess population risk to $ ilde{O}(\frac{ d^2}{ nε^2 })$. To lift these additional conditions, we also provide a gradient smoothing and trimming based scheme to achieve excess population risks of $ ilde{O}(\frac{ d^2}{nε^2})$ and $ ilde{O}(\frac{d^\frac{2}{3}}{(nε^2)^\frac{1}{3}})$ for strongly convex and general convex loss functions, respectively, extit{with high probability}. Experiments suggest that our algorithms can effectively deal with the challenges caused by data irregularity.

연구 동기 및 목표

  • 무거운 尾 데이터에서 기울기가 유계가 아니어서 표준 가정이 성립하지 않을 경우 기존 DP-SCO 방법이 실패하는 문제를 해결한다.
  • 손실 함수가 리프시츠 또는 유계 노름 성질을 갖지 못할 수 있는 무거운 尾 데이터 분포 하에서 DP-SCO의 이론적 한계를 연구한다.
  • 데이터 또는 기울기가 무거운 尾일 경우에도 기능을 유지할 수 있는 새로운 차별적(private) 알고리즘을 설계한다.
  • 기울기의 두 번째 모멘트가 유계라는 최소한의 가정 하에서 초과 인구 위험 경계를 제공한다.
  • 합성 및 실제 무거운 尾 데이터 세트에서 제안된 알고리즘의 효과성을 검증한다.

제안 방법

  • 강력한 볼록성과 부드러운 손실 함수에 대해 표본-집계 프레임워크를 제안하여, 표준 가정 하에서 $ frac{d^3}{n ilde{ heta}^4}$의 초과 위험을 달성한다.
  • 하나의 차원(private) 평균 추정(Bun & Steinke, 2019)을 사용하는 기울기 하강 기반 알고리즘을 도입하여, 하중하중 및 리프시츠 기울기 가정 하에서 $ frac{d^2 ext{log}(1/ ilde{ heta})}{n ilde{ heta}^2}$의 기대 초과 위험을 달성한다.
  • 강력한 가정 없이도 무한 기울기를 다룰 수 있도록 기울기 자르기 및 스무딩 메커니즘(알고리즘 4)을 설계하여, 유계 두 번째 모멘트 조건에 의존한다.
  • 극단적인 기울기의 영향을 줄이기 위해 자르기를 적용하여, 차별적(private) 보장과 기능 유지의 균형을 이룬다.
  • 일반 볼록 및 강력한 볼록 손실 함수에 대해 고확률 농도 경계를 도출하기 위해, 농도 경계를 활용한다.
  • 고차원, 무거운 尾 환경에서의 강건성을 확보하기 위해, 비공개 평균 추정 기법을 통합한다.

실험 결과

연구 질문

  • RQ1데이터 또는 기울기가 무거운 尾를 지닐 경우, 표준 유계성 가정을 위반함에도 불구하고 차별적(private) 확률적 볼록 최적화를 효과적으로 수행할 수 있는가?
  • RQ2기울기의 유계 두 번째 모멘트 조건만을 가정할 때, 어떤 초과 인구 위험 경계를 달성할 수 있는가?
  • RQ3무거운 尾 데이터로 인해 표준 리프시츠 또는 유계 노름 가정이 위반될 경우 DP-SCO의 성능은 어떻게 저하되는가?
  • RQ4기울기 자르기 및 스무딩 전략은 기존의 출력 또는 기울기 흐림 기반 방법에 비해 무거운 尾 환경에서 강건한 대안이 될 수 있는가?
  • RQ5무거운 尾 DP-SCO에서, 비밀유지 파rameter($\epsilon, \delta$), 차원($d$), 표본 크기($n$), 초과 위험 간의 상호 상관 관계는 어떠한가?

주요 결과

  • 강력한 볼록성과 부드러운 손실 함수에 대해 표본-집계 방법은 고확률적으로 $ frac{d^3}{n ilde{ heta}^4}$의 초과 인구 위험을 달성한다.
  • 하중하중 및 리프시츠 기울기 가정 하에서 기울기 하강 기반 알고리즘은 $ frac{d^2\text{log}(1/\tilde{ heta})}{n ilde{ heta}^2}$의 기대 초과 위험을 달성한다.
  • 기울기의 유계 두 번째 모멘트 조건만을 가정할 경우, 자르기 기반 알고리즘은 강력한 볼록 손실에 대해 고확률적으로 $ frac{d^2\text{log}(1/\tilde{ heta})}{n ilde{ heta}^2}$의 초과 위험을 달성한다.
  • 동일한 조건 하에서 일반 볼록 손실에 대해 알고리즘은 고확률적으로 $ frac{d^{2/3}\text{log}(1/\tilde{ heta})}{(n ilde{ heta}^2)^{1/3}}$의 초과 위험을 달성한다.
  • 합성 및 실제 데이터 세트(Adult)에 대한 실험을 통해, 자르기 기반 알고리즘(알고리즘 4)이 비공개 방법과 유사한 성능을 보이며, 무거운 尾 노이즈에 대해 강건함을 확인하였다.
  • 사전 의존 알고리즘(알고리즘 3)은 사전 강도 $\kappa$에 민감하여, 무거운 尾 조건에서 불안정함을 보였지만, 알고리즘 4는 일관되고 확장 가능한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.