[논문 리뷰] Privacy Regularization: Joint Privacy-Utility Optimization in Language Models
이 논문은 언어 모델에서 비밀유지와 유틸리티를 공동 최적화하기 위한 두 가지 프라이버시 정규화 기법—판별자와 함께하는 적대적 훈련 및 새로운 트리플릿 손실 기반 정규화기법—을 제안한다. 이 방법들은 차별적 프라이버시(Privacy) 훈련보다 더 나은 프라이버시-유틸리티 트레이드오프를 달성하고, 더 빠른 훈련 속도를 보이며, 저조도 사용자 집단에 대한 불균형 영향도 감소시킨다.
Neural language models are known to have a high capacity for memorization of training samples. This may have serious privacy implications when training models on user content such as email correspondence. Differential privacy (DP), a popular choice to train models with privacy guarantees, comes with significant costs in terms of utility degradation and disparate impact on subgroups of users. In this work, we introduce two privacy-preserving regularization methods for training language models that enable joint optimization of utility and privacy through (1) the use of a discriminator and (2) the inclusion of a triplet-loss term. We compare our methods with DP through extensive evaluation. We show the advantages of our regularizers with favorable utility-privacy trade-off, faster training with the ability to tap into existing optimization approaches, and ensuring uniform treatment of under-represented subgroups.
연구 동기 및 목표
- 이메일 교환에서 사용자 신원과 같은 민감한 훈련 데이터를 언어 모델이 기억하는 것과 같은 프라이버시 위험을 해결한다.
- 차별적 프라이버시(DP) 훈련과 관련된 심각한 유틸리티 저하와 저조도 사용자 집단에 대한 불균형 영향을 해결한다.
- 차별적 프라이버시의 엄격한 일괄적 노이즈 주입에 의존하지 않고도 프라이버시와 모델 유틸리티를 공동 최적화할 수 있는 정규화 기법을 개발한다.
- 훈련 샘플 수가 적은 사용자에 대해 유틸리티 손실 격차를 최소화하여 공정한 대우를 보장한다.
- 기존 최적화 파이프라인과 호환되며, 복잡한 초모수 조정을 피하는, 확장 가능한 기울기 기반 DP의 대안을 제공한다.
제안 방법
- 언어 모델의 최종 은닉 상태에서 입력 시퀀스의 저자 예측을 위한 판별자를 훈련하고, 이 예측을 바탕으로 표현과 민감한 속성 간의 연결 가능성(linkability)을 허용하지 않도록 프라이버시 손실을 계산한다.
- 동일 저자로부터 온 시퀀스는 유사한 표현을 생성하도록 유도하고, 다른 저자 간의 표현은 서로 멀어지도록 하는 트리플릿 손실 정규화기를 도입함으로써 저자 연결 가능성 감소를 유도한다.
- 표준 언어 모델링 손실에 더해 프라이버시 정규화 손실를 결합하여 최적화함으로써, 표준 최적화 방법을 사용한 엔드 투 엔드 훈련을 가능하게 한다.
- 프라이버시 정규화를 위해 RNN의 마지막 은닉 상태 또는 트랜스포머의 [CLS] 토큰을 시퀀스 임베딩으로 사용하며, GDPR의 연결 가능한 정보 정의와 일치시킨다.
- DP-SGD와 마찬가지로 기울기 클리핑이나 노이즈 주입 없이도 훈련 중에 정규화기를 적용하여 저자 신원의 기억을 방지한다.
- 부분 프롬프트에서 전체 훈련 시퀀스를 복원하려는 탭 기반 복원 공격을 사용하여 모델을 평가하고, 복원 정확도로 성공률을 측정한다.
실험 결과
연구 질문
- RQ1프라이버시 정규화 기법은 차별적 프라이버시의 높은 유틸리티 비용을 지불하지 않고도 모델 역공격 위험을 줄일 수 있는가?
- RQ2다양한 데이터셋과 퍼플렉서티 수준에서 제안된 정규화기법이 DP와 비교해 프라이버시 보호 수준과 모델 유틸리티 측면에서 어떻게 성능을 내는가?
- RQ3제안된 정규화 기법은 DP 훈련에서 관찰된 바와 같이 저조도 사용자 집단에 대한 불균형 영향을 완화하는가?
- RQ4제안된 방법들은 표준 최적화 파이프라인을 사용해 효율적으로 훈련될 수 있는가? DP-SGD의 느린 수렴과 복잡한 초모수 조정 문제를 피할 수 있는가?
- RQ5이러한 정규화기를 사용해 훈련된 모델는 부분 프롬프트를 사용한 복원 공격에 얼마나 잘 견디는가?
주요 결과
- 제안된 정규화기는 특히 차별적 프라이버시가 균일한 노이즈를 적용해 관련성 있거나 반복적인 시퀀스를 충분히 보호하지 못하는 합성 캐니언 복원 상황에서 DP와 유사하거나 더 나은 프라이버시 보호를 달성한다.
- 고퍼플렉서티 모델의 경우 합성 캐니언에 대해 복원 정확도가 낮지만, 이는 저퍼플렉서티 모델에서 크게 증가하여 더 강한 기억 현상을 시사한다.
- 제안된 정규화기를 사용한 모델는 특히 기억 현상이 더 빈번하게 발생할 가능성이 있는 저퍼플렉서티 설정에서 DP보다 프라이버시와 유틸리티 측면에서 모두 뛰어난 성능을 보인다.
- 제안된 방법의 잘 표현된 사용자와 저조도 사용자 간 유틸리티 손실 격차는 7점에 불과하지만, DP의 경우 29점으로, 훨씬 더 낮은 불균형 영향을 보여준다.
- 정규화기는 더 빠른 훈련을 가능하게 하며 표준 최적화 기법과 호환되며, DP-SGD의 계산 오버헤드와 초모수 조정 부담을 피한다.
- 정규화기를 사용해 훈련된 모델는 탭 기반 복원 공격에 대해 더 낮은 공격 성공률을 보이며, 문법적 패턴을 따르는 실제 세계 캐니언에서 특히 DP 모델보다 뛰어난 저항성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.