Skip to main content
QUICK REVIEW

[논문 리뷰] Private Federated Learning in Gboard

Yuanbo Zhang, Daniel Ramage|arXiv (Cornell University)|2023. 06. 26.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 사용자 수준의 차별적 프라이버시(이하 DP-FTRL)와 분산 차별적 프라이버시를 결합한 하이브리드 프라이버시 보장 페더레이티드 러닝 시스템을 Gboard에 구현한 바 있다. 이는 사용자 타이핑 데이터를 보호하기 위해 보안 집계(SecAgg)와 함께 사용된다. 시스템은 모델 유틸리티에 거의 영향을 주지 않으면서도 강력한 프라이버시 보장을 달성하였으며, 이는 zCDP에서 ρ = 0.25를 기록한 실사용 언어 모델을 통해 입증되었다. 예측 정확도에 하락이 없었다.

ABSTRACT

This white paper describes recent advances in Gboard(Google Keyboard)'s use of federated learning, DP-Follow-the-Regularized-Leader (DP-FTRL) algorithm, and secure aggregation techniques to train machine learning (ML) models for suggestion, prediction and correction intelligence from many users' typing data. Gboard's investment in those privacy technologies allows users' typing data to be processed locally on device, to be aggregated as early as possible, and to have strong anonymization and differential privacy where possible. Technical strategies and practices have been established to allow ML models to be trained and deployed with meaningfully formal DP guarantees and high utility. The paper also looks ahead to how technologies such as trusted execution environments may be used to further improve the privacy and security of Gboard's ML models.

연구 동기 및 목표

  • 사용자 타이핑 패턴을 기반으로 학습된 언어 모델에서 개인 데이터의 모델 기억 현상 위험을 줄이기 위해 다양한 프라이버시 강화 기술을 통합함으로써 Gboard의 페더레이티드 러닝 시스템에서 사용자 프라이버시를 향상시키는 것.
  • 사용자 타이핑 패턴을 기반으로 학습된 언어 모델에서 개인 사용자 데이터의 모델 기억 현상 위험을 해결하는 것.
  • 기기에서 서버에 이르기까지 페더레이티드 러닝 파이프라인 전반에 걸쳐 엔드 투 엔드 프라이버시 보호를 실현하는 것.
  • 모바일 머신러닝 시스템에서 보안 집계 및 차별적 프라이버시의 효율성과 확장성을 향상시키는 것.
  • 미래의 페더레이티드 러닝 시스템에서 신뢰할 수 있는 실행 환경(TEEs)을 활용한 검증 가능한 프라이버시 주장의 기반을 마련하는 것.

제안 방법

  • 모델 파라미터에 대한 공식적인 중심 차별적 프라이버시 보장을 제공하기 위해 DP-FTRL(Differentially Private FTRL)을 사용하여 사용자 수준의 프라이버시를 보장한다.
  • 서버가 정직하지만 호기심이 많더라도 개별 모델 업데이트를 알 수 없도록 하기 위해 보안 집계(SecAgg)를 적용한다.
  • 전송 전에 모델 업데이트를 흐리게 하여 악성 서버로부터도 보호하기 위해 분산 차별적 프라이버시(DDP)를 통합한다.
  • 통신 및 계산 오버헤드를 줄이기 위해 하위그래프 SecAgg 프로토콜을 적용하여 대규모 모델에 대한 확장성을 향상시킨다.
  • 기기 수준의 액세스 제어, 확인 토큰, API 키 인증을 통해 클라이언트 무결성과 봇넷 악용 방지를 보장한다.
  • DP-FTRL과 SecAgg/DDP를 계층적 방어 전략으로 조합하여, 모델 학습 및 집계의 모든 단계에서 프라이버시 경계를 강화한다.

실험 결과

연구 질문

  • RQ1모바일 언어 모델에서 사용자 타이핑 데이터를 보호하기 위해 사용자 수준의 차별적 프라이버시를 보안 집계와 효과적으로 통합할 수 있는가?
  • RQ2DP-FTRL과 SecAgg/DDP를 적용할 경우 Gboard의 다음 단어 예측 모델의 유틸리티에 어떤 영향을 미치는가?
  • RQ3DP-FTRL과 SecAgg/DDP의 조합가능성이 모델 정확도를 떨어뜨리지 않으면서도 더 강력한 엔드 투 엔드 프라이버시 보장을 달성할 수 있는가?
  • RQ4수백만 대의 기기에서 효율적으로 확장 가능한 프라이버시 보장 페더레이티드 러닝을 실현하기 위해 저대역폭 및 저메모리 사용을 유지할 수 있는가?
  • RQ5신뢰할 수 있는 실행 환경(TEEs)이 향후 페더레이티드 러닝 시스템에서 검증 가능한 프라이버시 주장에 어떤 역할을 할 수 있는가?

주요 결과

  • 2023년 6월, 미국 영어용 다음 단어 예측을 위한 언어 모델이 DP-FTRL 및 SecAgg/DDP를 모두 적용한 최초의 실사용 구현이 이루어졌다.
  • DP-FTRL + SecAgg/DDP 조합 모델은 zCDP 프라이버시 예산 ρ = 0.25를 달성하였으며, 이는 이전 모델의 ρ = 1.31 대비 상당한 향상이다.
  • 기본 모델(단독으로 DP-FTRL로 학습된 모델)과 동일한 예측 선택 비율과 정확도를 유지하여 유틸리티 저하가 없음을 확인하였다.
  • SecAgg로 학습된 키별 수정 유도 모델이 생산 환경에 성공적으로 도입되었으며, 품질에 중립적인 영향을 미쳤다.
  • 하위그래프 SecAgg 프로토콜을 통해 다양한 크기의 모델(약 1,000에서 약 300만 파라미터)에 걸쳐 SecAgg의 효율적 구현이 가능했다.
  • 격리 경계, 액세스 제어, 메타데이터 및 식별자 즉시 삭제를 통해 강력한 데이터 최소화 및 익명화를 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.