Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Learning of N-gram Language Models

Mingqing Chen, Ananda Theertha Suresh|arXiv (Cornell University)|2019. 10. 08.
Privacy-Preserving Technologies in Data참고 문헌 29인용 수 18
한 줄 요약

이 논문은 중앙 서버에 사용자 데이터를 수집하지 않고도 가상 키보드를 위한 고품질 n-gram 언어 모델을 훈련하기 위한 피어드러닝 프레임워크를 제안한다. 먼저 기기 내에서 피어드 어워징을 통해 순환 신경망(RNN)을 훈련한 후, 신경망에서 유추한 구조와 외부 코퍼스의 구조를 결합하여 n-gram 모델로 근사함으로써, 기존의 서버 기반 훈련 방식을 뛰어넘는 뛰어난 다음 단어 예측 정확도를 달성한다. A/B 테스트 결과, 영어에서는 최대 10.53%의 top-1 정확도 향상, 브라질 포르투갈어에서는 9.65% 향상이 확인되었다.

ABSTRACT

We propose algorithms to train production-quality n-gram language models using federated learning. Federated learning is a distributed computation platform that can be used to train global models for portable devices such as smart phones. Federated learning is especially relevant for applications handling privacy-sensitive data, such as virtual keyboards, because training is performed without the users' data ever leaving their devices. While the principles of federated learning are fairly generic, its methodology assumes that the underlying models are neural networks. However, virtual keyboards are typically powered by n-gram language models for latency reasons. We propose to train a recurrent neural network language model using the decentralized FederatedAveraging algorithm and to approximate this federated model server-side with an n-gram model that can be deployed to devices for fast inference. Our technical contributions include ways of handling large vocabularies, algorithms to correct capitalization errors in user data, and efficient finite state transducer algorithms to convert word language models to word-piece language models and vice versa. The n-gram language models trained with federated learning are compared to n-grams trained with traditional server-based algorithms using A/B tests on tens of millions of users of virtual keyboard. Results are presented for two languages, American English and Brazilian Portuguese. This work demonstrates that high-quality n-gram language models can be trained directly on client mobile devices without sensitive training data ever leaving the devices.

연구 동기 및 목표

  • 중앙 서버에 사용자가 입력한 원본 데이터를 전송하지 않고도 모바일 가상 키보드를 위한 생산 수준의 n-gram 언어 모델을 훈련할 수 있도록 하는 것.
  • 어형이 풍부한 언어에서 어휘 집합이 크고 데이터가 흐려져 있어 직접적인 n-gram 피어드러닝 훈련이 불가능한 문제를 해결하는 것.
  • 피어드러닝을 통해 훈련된 RNN을 활용해 기기에서 저지연 시간으로 추론이 가능한 고품질의 n-gram 근사 모델을 개발하는 것.
  • 사용자가 입력한 훈련 데이터에서 일관되지 않은 대문자 사용과 OOV(어휘 외 단어) 문제와 같은 데이터 품질 문제를 해결하는 것.
  • 두 언어에서 수천만 명의 사용자 대상 실시간 A/B 테스트를 통해 결과 모델의 예측 정확도를 평가하는 것

제안 방법

  • 사용자 기기에서 FederatedAveraging를 사용해 순환 신경망 언어 모델(RNN LM)을 훈련하여 사용자 데이터가 기기 외부로 유출되지 않도록 보장한다.
  • SampleApprox 알고리즘을 사용해 훈련된 RNN LM을 효율적인 기기 내 추론을 위한 유한 상태 변환기 기반 n-gram 모델로 근사한다.
  • 신경망에서 유추한 n-gram 구조와 외부 대규모 코퍼스 구조(A_W)를 결합하여 커버리지 향상과 데이터 흐림 완화를 도모하며, 특히 희귀어나 OOV 단어에 대해 유리하다.
  • 모델 훈련 이전에 사용자 입력 텍스트의 일관되지 않은 대문자 사용을 수정하기 위해 자동 상태 기반 변환기(FST)를 적용한다.
  • OOV 단어를 제외한 수정된 SLL^e 지표를 사용해 모델 선택을 유도하며, 어휘 내 성능에 집중한다.
  • 가상 키보드 애플리케이션의 실시간 생산 트래픽에서 결과 n-gram 모델을 배포하고 평가한다.

실험 결과

연구 질문

  • RQ1피어드러닝을 통해 기기 내에서 직접 원시 사용자 데이터를 노출시키지 않고 고품질의 n-gram 언어 모델을 훈련시킬 수 있는가?
  • RQ2피어드러닝 RNN LM를 n-gram 모델로 근사하는 것이 중앙 집중식 로그에서 직접 n-gram을 훈련시키는 것보다 성능이 뛰어나게 되는가?
  • RQ3신경망에서 유추한 n-gram 구조와 외부 코퍼스 구조를 결합하는 것이 모델 품질 향상과 커버리지 향상에 얼마나 효과적인가?
  • RQ4대문자 정규화와 워드피ece 모델링이 피어드러닝 n-gram 훈련에서 발생하는 데이터 품질 문제를 어느 정도 완화하는가?
  • RQ5실제 사용자 환경에서의 예측 정확도 측면에서 결과 n-gram 모델이 기존의 서버 기반 훈련 방식을 뛰어넘을 수 있는가?

주요 결과

  • 피어드러닝 RNN 기반 n-gram 모델(A_P_r)은 영어(en_US)에서 top-1 예측 정확도 10.53%를 기록하여 기준 모델의 10.03%를 크게 초월했다.
  • 브라질 포르투갈어(pt_BR)에서는 최고의 피어드러닝 모델(A_P_r)이 9.65%의 top-1 정확도를 기록했으며, 기준 모델의 8.55%보다 높았다.
  • 워드피ece 모델(P_4K-L)은 en_US에서 SLL^e 10.49를 기록하여 동일 언어에서 워드 모델(W_30K)의 10.46 SLL^e를 능가했다.
  • 통합된 구조(A_r)를 사용한 모델은 순수하게 신경망에서 유추한 또는 순수하게 외부 코퍼스 기반의 구조를 사용한 모델보다 일관되게 뛰어난 성능을 보였다.
  • SLL^e 지표는 GLSTM 아키텍처를 사용한 4K 워드피iece 모델이 16K 및 30K 워드피iece 모델보다 더 우수한 성능을 보였으며, 이는 이 설정에서 최적의 어휘 크기를 시사한다.
  • 모든 피어드러닝 모델이 A/B 테스트에서 기준 모델을 크게 앞서며, n-gram 모델에 대한 피어드러닝 훈련의 실현 가능성과 우수성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.