Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Tuning Large Language Models with User-Level Differential Privacy

Zachary Charles, Arun Ganesh|arXiv (Cornell University)|2024. 07. 10.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 위한 두 가지 실용적인 사용자 수준의 차별적(private) 미세조정 방법, 즉 예제 수준 샘플링(Example-Level Sampling, ELS)과 사용자 수준 샘플링(User-Level Sampling, ULS)을 제안하고 평가한다. ELS에 대해 새로운, 증명 가능한 날카운 사용자 수준 DP 회계 방법을 도입하며, 강한 비밀유지 제약 조건이나 큰 컴퓨팅 예산 하에서 ULS가 일반적으로 ELS보다 성능이 뛰어나며, 이는 노이즈와 클리핑 간의 보다 우수한 트레이드오프 덕분이다.

ABSTRACT

We investigate practical and scalable algorithms for training large language models (LLMs) with user-level differential privacy (DP) in order to provably safeguard all the examples contributed by each user. We study two variants of DP-SGD with: (1) example-level sampling (ELS) and per-example gradient clipping, and (2) user-level sampling (ULS) and per-user gradient clipping. We derive a novel user-level DP accountant that allows us to compute provably tight privacy guarantees for ELS. Using this, we show that while ELS can outperform ULS in specific settings, ULS generally yields better results when each user has a diverse collection of examples. We validate our findings through experiments in synthetic mean estimation and LLM fine-tuning tasks under fixed compute budgets. We find that ULS is significantly better in settings where either (1) strong privacy guarantees are required, or (2) the compute budget is large. Notably, our focus on LLM-compatible training algorithms allows us to scale to models with hundreds of millions of parameters and datasets with hundreds of thousands of users.

연구 동기 및 목표

  • 모든 사용자의 데이터가 보호되는 사용자 수준의 차별적(private) 보장을 확보하면서, 대규모 언어 모델을 확장 가능하고 실용적인 알고리즘으로 미세조정하기 위한 방법 개발.
  • 사용자가 여러 상관관계가 있는 예제를 기여하는 환경에서 예제 수준 DP의 한계를 해결하여, 사용자 수준의 소속성 추론 공격을 방지.
  • 특히 ELS 변형에 대해, LLM 학습 맥락에서 사용자 수준 DP의 증명 가능한 날카운 회계 제공.
  • 고정된 컴퓨팅 예산 하에서 다양한 비밀유지 요구 조건에서 ELS와 ULS의 성능을 경험적으로 비교하여 최적의 구성 전략 식별.
  • 수백만 개의 파라미터를 가진 모델과 수십만 명의 사용자가 포함된 데이터셋을 사용하여 실제 LLM 미세조정 작업에서 방법의 유효성 검증.

제안 방법

  • DP-SGD-ELS를 제안: 예제 수준 샘플링과 개별 예제의 기울기 클리핑을 적용한 DP-SGD를 수행하고, 새로운 그룹 기반 비밀유지 분석을 통해 사용자 수준의 비밀유지 보장을 도출.
  • DP-SGD-ULS를 제안: 사용자 수준 샘플링과 사용자 기반 기울기 클리핑을 적용하며, 각 사용자 내 다수의 예제를 평균화한 후 클리핑을 수행.
  • 예제를 그룹화한 하위 샘플링 가우시안 메커니즘의 조합을 분석하여, ELS에 대해 증명 가능한 날카운 사용자 수준 DP 회계를 개발.
  • 고정된 컴퓨팅 예산 하에서 유효성과 비밀유지 간의 트레이드오프를 비교하기 위해 합성 평균 추정 작업과 실제 LLM 미세조정 작업(예: Stack Overflow, CC-News)을 활용.
  • G_{\text{ULS}}와 M의 하이퍼파라미터를 튜닝하기 위해 오라클, 추정-두배, 무작위, 최대 코hort, 최대 그룹 크기 등의 구성 전략 세트를 활용.
  • 개별 사용자 데이터로 주요 모델을 추가로 미세조정하여, 최종 유효성과 비밀유지 간 트레이드오프를 평가함으로써 개인화 성능 평가.
Figure 1 : Upper bound on $\varepsilon$ for ELS using our Mixture-of-Gaussians (MoG) accountant and the prior state-of-the-art black-box accounting from [ 23 ] . We set $T=2000$ iterations, sampling probability $p=10^{-2}$ , $\delta=10^{-6}$ , and vary $\sigma_{\text{ELS}}$ and $G_{\text{ELS}}$ . Fo
Figure 1 : Upper bound on $\varepsilon$ for ELS using our Mixture-of-Gaussians (MoG) accountant and the prior state-of-the-art black-box accounting from [ 23 ] . We set $T=2000$ iterations, sampling probability $p=10^{-2}$ , $\delta=10^{-6}$ , and vary $\sigma_{\text{ELS}}$ and $G_{\text{ELS}}$ . Fo

실험 결과

연구 질문

  • RQ1대규모 LLM을 효과적이고 효율적으로 미세조정하기 위해 사용자 수준의 차별적(private) 보장을 어떻게 적용할 수 있는가?
  • RQ2비밀유지, 유효성, 계산 효율성 측면에서 예제 수준 샘플링(ELS)과 사용자 수준 샘플링(ULS) 간의 상대적 성능 트레이드오프는 어떠한가?
  • RQ3새로운 사용자 수준 DP 회계가 일반적인 예제-사용자 변환보다 ELS에 대해 증명 가능한 더 날카운 비밀유지 경계를 제공할 수 있는가?
  • RQ4고정된 컴퓨팅 예산 하에서, ELS와 ULS 중 어느 방법이 더 높은 모델 유효성을 제공하며, 각 방법이 어떤 조건에서 뛰어난 성능을 발휘하는가?
  • RQ5ELS와 ULS로 훈련된 모델에 대해 개인화가 비밀유지-유효성 트레이드오프에 어떤 영향을 미치는가?

주요 결과

  • 제안된 ELS를 위한 사용자 수준 DP 회계는 일반적인 예제-사용자 변환보다 증명 가능한 더 날카운 비밀유지 경계를 제공하며, 이는 비밀유지-유효성 트레이드오프를 크게 향상시킨다.
  • 각 사용자가 다양한 예제를 기여할 경우, ULS는 강한 비밀유지 제약 조건($\varepsilon \leq 16$)이나 큰 컴퓨팅 예산 하에서 항상 ELS보다 높은 모델 유효성 성능을 보인다.
  • ULS는 노이즈 배수 $\sigma$와 클리핑 노름 $C$ 간의 트레이드오프를 허용하지만, ELS는 $\sigma$만 줄일 수 있어 수익 감소 효과가 나타나는 한계가 있다.
  • ULS의 $G_{\text{ULS}}$와 $M$ 설정을 위한 추정-두배 히우리스틱 전략은 모든 컴퓨팅 예산과 비밀유지 수준에서 오라클 전략과 거의 동일한 성능을 보인다.
  • 개인화로 인해 ELS와 ULS 양쪽 모두 유효성이 향상되지만, 두 방법 간 상대적 성능 격차는 일관되게 유지되며, 개인화 후에도 ULS는 여전히 우월한 성능 유지를 보인다.
  • 본 연구는 사용자 수준 DP를 적용한 LLM의 확장 가능한 훈련을 입증하였으며, 수백만 개의 파라미터를 가진 모델과 수십만 명의 사용자가 포함된 데이터셋에서 효과적인 비밀유지 보장을 달성하였다.
(b) Noise variance of ELS and ULS for varying compute budgets and different relative values of $L_{\text{ELS}}$ and $L_{\text{ULS}}$ .
(b) Noise variance of ELS and ULS for varying compute budgets and different relative values of $L_{\text{ELS}}$ and $L_{\text{ULS}}$ .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.