[논문 리뷰] When Does Differentially Private Learning Not Suffer in High Dimensions?
이 논문은 기울기가 저차원 부분공간에 집중될 경우, 차별적(private) 경사하강법(DP-SGD)이 고차원 학습에서 치수에 의존하지 않는 성능을 달성할 수 있음을 규명한다. '제한된 리프시츠 연속성'을 도입함으로써, 기울기 투영 크기가 감소할 경우 모델 치수에 관계없이 초과 위험의 경계를 도출하였으며, 이는 대규모 사전학습 모델이 이론적으로는 성능 저하가 예상됨에도 불구하고 사생활 보호적 미세조정에서 성공할 수 있는 이유를 설명한다.
Large pretrained models can be privately fine-tuned to achieve performance approaching that of non-private models. A common theme in these results is the surprising observation that high-dimensional models can achieve favorable privacy-utility trade-offs. This seemingly contradicts known results on the model-size dependence of differentially private convex learning and raises the following research question: When does the performance of differentially private learning not degrade with increasing model size? We identify that the magnitudes of gradients projected onto subspaces is a key factor that determines performance. To precisely characterize this for private convex learning, we introduce a condition on the objective that we term \emph{restricted Lipschitz continuity} and derive improved bounds for the excess empirical and population risks that are dimension-independent under additional conditions. We empirically show that in private fine-tuning of large language models, gradients obtained during fine-tuning are mostly controlled by a few principal components. This behavior is similar to conditions under which we obtain dimension-independent bounds in convex settings. Our theoretical and empirical results together provide a possible explanation for recent successes in large-scale private fine-tuning. Code to reproduce our results can be found at \url{https://github.com/lxuechen/private-transformers/tree/main/examples/classification/spectral_analysis}.
연구 동기 및 목표
- 사생활 보호적 볼록 학습에서 치수에 의존하는 오차 예측과 실제 대규모 모델 미세조정 성공 간의 명백한 모순을 해결하기 위해.
- 모델 크기가 증가함에 따라 사생활 보호 학습의 성능이 떨어지지 않는 조건을 규명하기 위해.
- 기울기 집중이 치수에 독립적인 사생활-유용성 트레이드오프를 가능하게 하는 조건을 수식화한 새로운 분석 조건인 '제한된 리프시츠 연속성'을 정의하기 위해.
- 대규모 언어 모델의 미세조정 기울기가 몇 개의 주요 성분에 의해 지배됨을 실증적으로 검증하여 이론적 조건과 일치함을 보여주기 위해.
- 알고리즘 수정이나 공개 데이터가 필요 없이, 차별적(private) 기반의 밀집 미세조정의 효과성에 대한 이론적 기반을 제공하기 위해.
제안 방법
- 기울기 크기가 다양한 치수의 부분공간에 투영된 경우를 고려하는 표준 리프시츠 연속성의 일반화인 '제한된 리프시츠 연속성'을 도입한다.
- 이 조건 하에서 DP-SGD의 초과 경험 위험과 초과 인구 위험에 대해 개선된 상한 경계를 도출하며, 제한된 리프시츠 계수의 부분공간 치수에 따라 빠르게 감소할 경우 치수에 독립적인 결과를 보여준다.
- 기울기가 전체 환경 공간을 차지하는 비제약 최적화 문제를 분석하며, 부분공간에 대한 기울기 투영 크기가 감소함에 따라 오차 경계가 여전히 치수에 독립적임을 보여준다.
- 대규모 언어 모델의 미세조정 기울기에 대해 스펙트럼 분석을 수행하여 대부분의 기울기 에너지가 몇몇 주요 성분에 집중되어 있음을 실증적으로 입증한다.
- 기존의 작업과 비교하여, DP-SGD를 수정하거나 공개 데이터가 필요 없이도 성능 향상이 달성되었음을 보여주며, 이는 이전의 부분공간 제어 방법과 다름을 보여준다.
- 기존의 내재 치수 및 헤시안 부분공간 안정성 결과를 활용하여 실증적 발견을 딥 러닝 일반화의 광범위한 맥락 속에서 해석한다.
실험 결과
연구 질문
- RQ1차별적 사생활 보호 학습이 모델 치수 증가에 따라 성능 저하를 피할 수 있는 조건은 무엇인가?
- RQ2기울기가 전체 공간을 차지하는 비제약 볼록 최적화 문제에서 DP-SGD에 대해 치수에 독립적인 오차 경계를 도출할 수 있는가?
- RQ3부분공간에 투영된 기울기 크기가 고차원 사생활 보호 학습에서 사생활-유용성 트레이드오프에 어떻게 영향을 주는가?
- RQ4미세조정된 대규모 언어 모델의 기울기가 어느 정도까지 저차원 부분공간에 존재하는가? 그리고 이는 그들의 실증적 성공을 설명할 수 있는가?
- RQ5대규모 사생활 보호적 미세조정의 관찰된 성공은 알고리즘 간섭이나 공개 데이터에 의존하지 않고 이론적으로 설명될 수 있는가?
주요 결과
- 제안된 제한된 리프시츠 연속성 조건은 부분공간 치수에 따라 제한된 리프시츠 계수가 빠르게 감소할 경우, DP-SGD에서 치수에 독립적인 초과 위험 경계를 가능하게 한다.
- 기울기가 전체 환경 공간을 차지하더라도, 부분공간에 투영된 기울기 크기가 충분히 빠르게 감소할 경우 DP-SGD는 치수에 독립적인 오차를 달성할 수 있다.
- 실증 분석 결과, 대규모 언어 모델의 미세조정 기울기는 주로 몇몇 주요 성분에 포함되어 있으며, 이는 치수에 독립적인 성능을 위한 이론적 조건을 지지한다.
- 이론적 프레임워크는 DP-SGD 하에서 밀집 미세조정이 희소 미세조정과 비슷한 효과를 낼 수 있음을 설명하며, 이는 이전에 고차원에서 성능 저하가 예상되었던 것과는 정반대이다.
- 결과적으로, DP-SGD 알고리즘의 수정이나 공개 데이터 접근 없이도, 더 큰 모델을 사생활 보호 하에서 미세조정할 경우 관찰된 유용성 향상에 대한 이론적 근거를 제공한다.
- 기존의 랭크에 의존하는 경계 연구를 확장하여, 기울기가 고정된 저랭크 부분공간에 있어야 한다는 조건이 제거되어, 이 조건이 더 넓은 범위에 적용 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.