Skip to main content
QUICK REVIEW

[논문 리뷰] Enabling Differentially Private Federated Learning for Speech Recognition: Benchmarks, Adaptive Optimizers and Gradient Clipping

Martin Pelikán, Sheikh Shams Azam|arXiv (Cornell University)|2023. 09. 29.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 엔드 투 엔드 자동 음성 인식(ASR)에서 이질적인 기울기 문제를 완화하기 위해 각 레이어별 기울기 클리핑과 레이어별 적응형 기울기 정규화를 활용한, 차별적 비공개 페더레이티드 러닝(DP-FL)을 위한 첫 번째 실용적 프레임워크를 제안한다. 깊이 있는 트랜스포머 모델에서 기울기 이질성을 효과적으로 완화함으로써, 현실적인 사용자 규모 조건에서도 강력한 프라이버시 보장을 달성한다. 이는 (7.2, 10⁻⁹)-DP를 확보하면서도 비공개 중심 학습 대비 단지 1.3%p의 절대 WER 증가를 보이며, 향후 ASR 분야의 DP-FL 연구를 위한 기준을 설정한다.

ABSTRACT

While federated learning (FL) and differential privacy (DP) have been extensively studied, their application to automatic speech recognition (ASR) remains largely unexplored due to the challenges in training large transformer models. Specifically, large models further exacerbate issues in FL as they are particularly susceptible to gradient heterogeneity across layers, unlike the relatively uniform gradient behavior observed in shallow models. As a result, prior works struggle to converge with standard optimization techniques, even in the absence of DP mechanisms. To the best of our knowledge, no existing work establishes a competitive, practical recipe for FL with DP in the context of ASR. To address this gap, we establish extbf{the first benchmark for FL with DP in end-to-end ASR}. Our approach centers on per-layer clipping and layer-wise gradient normalization: theoretical analysis reveals that these techniques together mitigate clipping bias and gradient heterogeneity across layers in deeper models. Consistent with these theoretical insights, our empirical results show that FL with DP is viable under strong privacy guarantees, provided a population of at least several million users. Specifically, we achieve user-level (7.2, $10^{-9}$)-DP (resp. (4.5, $10^{-9}$)-DP) with only a 1.3% (resp. 4.6%) absolute drop in word error rate when extrapolating to high (resp. low) population scales for FL with DP in ASR. Although our experiments focus on ASR, the underlying principles we uncover - particularly those concerning gradient heterogeneity and layer-wise gradient normalization - offer broader guidance for designing scalable, privacy-preserving FL algorithms for large models across domains. Code of all experiments and benchmarks is available at https://github.com/apple/ml-pfl4asr.

연구 동기 및 목표

  • 대규모 ASR 모델, 특히 엔드 투 엔드 트랜스포머 모델에 대한 실용적이고 스케일러블한 DP-FL의 격차를 메우기 위해.
  • DP를 적용한 페더레이티드 러닝 환경에서 깊이 있는 모델의 레이어 간 기울기 이질성 문제를 해결하기 위해.
  • 강력한 (ε, δ)-차별적 비공개 보장을 제공하는 ASR 분야의 경쟁력 있고 재현 가능한 DP-FL 기준을 설정하기 위해.
  • 각 레이어별 클리핑이 레이어별 기울기 정규화와 조합될 경우, 강력한 프라이버시 제약 조건 하에서도 수렴성과 높은 성능을 달성할 수 있음을 입증하기 위해.
  • 대규모, 프라이버시 보장이 되는 페더레이티드 러닝을 위한 제안된 최적화 전략에 대한 이론적 및 실증적 검증을 제공하기 위해.

제안 방법

  • 딥 트랜스포머 모델에서 기울기 이질성과 편향을 줄이기 위해 각 레이어별 기울기 클리핑과 레이어별 적응형 기울기 정규화를 조합한 방법을 제안한다.
  • 엔드 투 엔드 ASR를 위해 CTC 손실 함수를 사용하여 훈련하는 250M 파라미터의 단순 인코더 기반 트랜스포머 모델을 사용한다.
  • 각 클라이언트에 대해 가우시안 노이즈를 주입하고 클리핑 기준과 프라이버시 회계를 통해 조정된 사용자 수준의 (ε, δ)-차별적 비공개를 적용한다.
  • 중앙 최적화기로 LAMB를, 로컬 최적화기로 SGD를 사용하며, 안정적인 훈련을 위해 학습률 웜업 및 감쇠 전략을 적용한다.
  • 수렴성을 향상시키기 위해 관련 도메인의 사전 학습된 모델을 사용해 시드 모델을 미세조정하는 전략을 도입한다.
  • 엄격한 프라이버시 회계와 수렴 분석을 수행하며, 제안된 클리핑 및 정규화 기법에 대한 이론적 근거를 제공한다.

실험 결과

연구 질문

  • RQ1레이어 간 기울기 이질성으로 인해 대규모 엔드 투 엔드 ASR 모델에 DP-FL를 효과적으로 적용할 수 있는가?
  • RQ2각 레이어별 클리핑이 레이어별 기울기 정규화와 조합될 경우, DP-FL에서 ASR의 수렴성과 성능을 향상시키는가?
  • RQ3실제 사용자 규모에서 프라이버시 예산 (ε, δ)와 ASR 모델 정확도 사이의 상호 교환 관계는 어떠한가?
  • RQ4데이터 이질성, 최적화기 하이퍼파라미터, 모델 초기화 방식은 DP-FL에서 ASR의 수렴에 어떤 영향을 미치는가?
  • RQ5강력한 프라이버시 보장 조건 하에서도 중심 학습 성능에 근접하는 실용적이고 경쟁력 있는 DP-FL 학습 레시피를 ASR 분야에 정립할 수 있는가?

주요 결과

  • 수백만 명의 사용자 규모에서, 비공개 중심 학습 대비 단지 1.3%p의 절대 WER 증가로 (7.2, 10⁻⁹)-DP를 달성한다.
  • 낮은 사용자 규모일 경우, (4.5, 10⁻⁹)-DP를 확보하면서도 WER가 4.6%p 증가하여 강력한 프라이버시-정확도 트레이드오프를 입증한다.
  • 각 레이어별 클리핑과 레이어별 기울기 정규화의 조합은 기울기 이질성과 클리핑 편향을 감소시켜, 기존 방법이 실패하는 깊이 있는 모델에서도 수렴 가능하게 한다.
  • 특히 서로 다른 도메인의 사전 학습된 시드 모델을 사용해 미세조정할 경우, 이질적인 클라이언트 데이터 상황에서도 경쟁력 있는 성능을 달성한다.
  • 이론적 분석을 통해 제안된 방법이 DP-FL 환경에서 훈련 동역학을 안정화시키고 수렴성을 향상시킨다는 점을 확인한다.
  • 기준과 코드베이스(https://github.com/apple/ml-pfl4asr)가 공개되어 재현성과 향후 ASR 분야의 DP-FL 연구를 위한 기반을 마련한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.