Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-Tuning with Differential Privacy Necessitates an Additional Hyperparameter Search

Yannis Cattan, Christopher A. Choquette-Choo|arXiv (Cornell University)|2022. 10. 05.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 사전학습된 모델의 첫 번째 및 마지막 레이어만 미세조정하는 것—전체 모델이나 마지막 레이어만 미세조정하는 것보다—다양한 비밀성 정확도 트레이드오프를 크게 향상시킨다고 제안한다. DP-SGD에서 노이즈가 가해지는 학습 가능한 파라미터 수를 줄임으로써 이 방법은 최신 기술 수준의 성능을 달성하며, (ε=2, δ=10⁻⁵)-DP 조건 하에서 CIFAR-100에서 77.9%의 정확도를 기록하여 이전 방법들보다 최대 3.2%포인트 높은 성능을 보였다.

ABSTRACT

Models need to be trained with privacy-preserving learning algorithms to prevent leakage of possibly sensitive information contained in their training data. However, canonical algorithms like differentially private stochastic gradient descent (DP-SGD) do not benefit from model scale in the same way as non-private learning. This manifests itself in the form of unappealing tradeoffs between privacy and utility (accuracy) when using DP-SGD on complex tasks. To remediate this tension, a paradigm is emerging: fine-tuning with differential privacy from a model pretrained on public (i.e., non-sensitive) training data. In this work, we identify an oversight of existing approaches for differentially private fine tuning. They do not tailor the fine-tuning approach to the specifics of learning with privacy. Our main result is to show how carefully selecting the layers being fine-tuned in the pretrained neural network allows us to establish new state-of-the-art tradeoffs between privacy and accuracy. For instance, we achieve 77.9% accuracy for $(\varepsilon, δ)=(2, 10^{-5})$ on CIFAR-100 for a model pretrained on ImageNet. Our work calls for additional hyperparameter search to configure the differentially private fine-tuning procedure itself.

연구 동기 및 목표

  • 기존의 비밀성 학습을 위한 미세조정 방법들이 비밀성 학습의 고유한 제약 조건을 최적화했는지 조사하기 위해.
  • 모델 크기가 커질수록 노이즈 스케일링이 증가함에 따라 DP-SGD에서 성능 저하가 발생하는 문제를 해결하기 위해.
  • 선택적 레이어 미세조정이 추가 하이퍼파rameter 튜닝 없이도 비밀성-유용성 트레이드오프를 완화시킬 수 있는지 탐색하기 위해.
  • 최소한의 아키텍처 수정으로 시각 기반 벤치마크에서 새로운 최신 기술 수준의 비밀성-정확도 성능을 확립하기 위해.

제안 방법

  • 사전학습된 신경망의 첫 번째 및 마지막 레이어만 미세조정하고, 나머지 모든 레이어는 동결한다.
  • 이 방법은 DP-SGD에서 비밀성 정책 노이즈가 가해지는 총 파라미터 수를 줄여 효과적인 노이즈 크기를 낮춘다.
  • 저자들은 나머지 학습 가능한 파라미터에 맞게 노이즈 스케일링을 조정한 표준 DP-SGD를 적용하며, (ε,δ)-DP 보장을 유지한다.
  • 이 방법은 이전 연구와 동일한 실험 설정을 기반으로 평가되었으며, 동일한 모델 아키텍처(28-10 Wide-ResNet)와 데이터셋(CIFAR-10, CIFAR-100)을 사용했다.
  • 모든 다른 하이퍼파rameter를 동일하게 유지한 채, 전체 모델 미세조정 및 마지막 레이어만 미세조정하는 두 가지 베이스라인과 비교했다.

실험 결과

연구 질문

  • RQ1사전학습된 모델의 첫 번째 및 마지막 레이어만 선택적으로 미세조정하는 것이 비밀성 학습에서 비밀성-정확도 트레이드오프를 향상시키는가?
  • RQ2DP 미세조정에서 학습 가능한 파라미터 수를 줄임으로써 DP-SGD에 내재된 노이즈 스케일링 문제를 완화할 수 있는가?
  • RQ3첫 번째-마지막 레이어 미세조정의 성능 향상은 다양한 비밀성 예산과 데이터셋에서 일관되게 나타나는가?
  • RQ4기존 방법들이 모든 레이어나 마지막 레이어만 미세조정하는 데서 이 선택적 전략에 비해 성능이 열등한 이유는 무엇인가?

주요 결과

  • 제안된 첫 번째-마지막 레이어 미세조정 방법은 (ε=2, δ=10⁻⁵)-DP 조건 하에서 CIFAR-100에서 77.9%의 정확도를 기록했으며, 이는 이전 최신 기술 수준인 74.7%보다 3.2%포인트 높은 성능이다.
  • CIFAR-10에서는 (ε=8, δ=10⁻⁵)-DP 조건 하에서 96.4%의 정확도를 기록했으며, 전체 모델 및 마지막 레이어 기반 베이스라인 모두를 초월했다.
  • 낮은 비밀성 예산에서 성능 향상이 가장 두드러지며, ε=1일 때 CIFAR-100에서 3.4%포인트의 향상이 있었다.
  • CIFAR-10과 CIFAR-100 양쪽 데이터셋에서 모든 평가된 비밀성 예산에서 이 방법은 전체 모델 및 마지막 레이어 미세조정을 일관되게 능가했다.
  • 기타 하이퍼파rameter를 수정하지 않고도 성능 향상이 달성되었으며, 이는 레이어 선택이 DP 미세조정에서 이전에 간과되었던 핵심 하이퍼파ram터임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.