[論文レビュー] Federated Learning of N-gram Language Models
本稿では、中央サーバーにユーザーのデータを一切収集しないように、仮想キーボード用の高品質なn-gram言語モデルを訓練するフェデレーテッドラーニングフレームワークを提案する。まず、デバイス上でフェデレーテッドアveragingを用いて再帰的ニューラルネットワーク(RNN)を訓練した後、神経的に推定されたトポロジーと外部コーパスのトポロジーを用いてそれをn-gramモデルに近似することで、従来のサーバー基盤の訓練法を上回る次単語予測の正確性を達成した。A/Bテストでは、英語で最大10.53%、ブラジルポルトガル語で最大9.65%のトップ1の正確性向上が確認された。
We propose algorithms to train production-quality n-gram language models using federated learning. Federated learning is a distributed computation platform that can be used to train global models for portable devices such as smart phones. Federated learning is especially relevant for applications handling privacy-sensitive data, such as virtual keyboards, because training is performed without the users' data ever leaving their devices. While the principles of federated learning are fairly generic, its methodology assumes that the underlying models are neural networks. However, virtual keyboards are typically powered by n-gram language models for latency reasons. We propose to train a recurrent neural network language model using the decentralized FederatedAveraging algorithm and to approximate this federated model server-side with an n-gram model that can be deployed to devices for fast inference. Our technical contributions include ways of handling large vocabularies, algorithms to correct capitalization errors in user data, and efficient finite state transducer algorithms to convert word language models to word-piece language models and vice versa. The n-gram language models trained with federated learning are compared to n-grams trained with traditional server-based algorithms using A/B tests on tens of millions of users of virtual keyboard. Results are presented for two languages, American English and Brazilian Portuguese. This work demonstrates that high-quality n-gram language models can be trained directly on client mobile devices without sensitive training data ever leaving the devices.
研究の動機と目的
- 中央サーバーにユーザーが入力した生のデータを一切送信せずに、モバイル用仮想キーボード向けの生産品質のn-gram言語モデルを訓練すること。
- 語彙が大きく、語形変化の豊かな言語ではデータが疎らであるため、n-gramの直接的なフェデレーテッドトレーニングが非現実的であるという制限を克服すること。
- フェデレーテッドRNNトレーニングを活用して、モバイルデバイス上で低遅延推論に適した高品質なn-gram近似モデルを生成する手法を開発すること。
- ユーザーが生成したトレーニングデータに見られる一貫性のない大文字表記や未知語(OOV)語といったデータ品質の問題を扱うこと。
- 2言語にわたり数千万人のユーザーを対象とした実際のA/Bテストを通じて、得られたn-gramモデルの性能を評価すること。
提案手法
- ユーザーのデータがデバイス外に漏れないように、クライアントデバイス上でフェデレーテッドアverージングを用いて再帰的ニューラルネットワーク言語モデル(RNN LM)を訓練する。
- サンプル近似(SampleApprox)アルゴリズムを用いて、訓練済みRNN LMを効率的なデバイス内推論に適した有限状態トランスダーサー基盤のn-gramモデルに近似する。
- 神経的に推定されたn-gramトポロジーと外部の大規模コーパストポロジー(A_W)を組み合わせることで、カバレッジを向上させ、特にレア語やOOV語のデータスパarsityを低減する。
- トレーニングの前段階で、ユーザー入力テキストにおける一貫性のない大文字表記を是正するため、大文字正規化FSTを適用する。
- OOV語を除いたSLL^eの修正版指標を用いてモデル選択をガイドし、語彙内性能に焦点を当てる。
- 得られたn-gramモデルを仮想キーボードアプリケーションのライブ生産トラフィック上でA/Bテストとしてデプロイし、評価する。
実験結果
リサーチクエスチョン
- RQ1フェデレーテッドラーニングを用いて、生のユーザーデータを露出させずに、モバイルデバイス上で高品質なn-gram言語モデルを直接訓練できるか?
- RQ2フェデレーテッドRNN LMをn-gramモデルに近似することで、中央集権的なログから直接n-gramを訓練するのと比較して、性能が向上するか?
- RQ3神経的に推定されたn-gramトポロジーと外部コーパストポロジーを組み合わせることで、モデル品質とカバレッジがどの程度向上するか?
- RQ4大文字正規化とワードピeceモデリングは、フェデレーテッドn-gramトレーニングにおけるデータ品質の問題をどの程度緩和できるか?
- RQ5得られたn-gramモデルは、実世界のユーザーの予測正確性において、従来のサーバー基盤の訓練法を上回る性能を示せるか?
主な発見
- フェデレーテッドRNNベースのn-gramモデル(A_P_r)は、英語(en_US)でトップ1の予測正確性が10.53%に達し、ベースラインモデルの10.03%を著しく上回った。
- ブラジルポルトガル語(pt_BR)においても、最良のフェデレーテッドモデル(A_P_r)は9.65%のトップ1正確性を達成したのに対し、ベースラインモデルは8.55%であった。
- ワードピースモデル(P_4K-L)は、en_USでSLL^eが10.49を記録し、同じ言語で10.46を記録したワードモデル(W_30K)を上回った。
- 統合トポロジー(A_r)を用いたモデルは、純粋に神経的に推定されたトポロジーや外部コーパスのみに依存するモデルよりも一貫して優れた性能を示した。
- SLL^e指標から、GLSTMアーキテクチャを用いた4Kワードピースモデルが16Kおよび30Kワードピースモデルよりも優れており、この設定における最適語彙サイズが示唆された。
- すべてのフェデレーテッドモデルがA/Bテストでベースラインモデルを著しく上回り、n-gramモデルに対するフェデレーテッドトレーニングの実現可能性と優位性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。