Skip to main content
QUICK REVIEW

[論文レビュー] Private Federated Learning in Gboard

Yuanbo Zhang, Daniel Ramage|arXiv (Cornell University)|Jun 26, 2023
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

この論文では、Gboardにおけるハイブリッドなプライバシー保護型フェデレーテッドラーニングシステムのデプロイを提示している。ユーザー単位の微分プライバシー(DP-FTRL)と、分散型微分プライバシー(DDP)を組み合わせたセキュアアグリゲーション(SecAgg)を用いて、ユーザーの入力データを保護している。このシステムは、モデルの性能にほとんど影響を与えることなく、強力なプライバシー保証を達成しており、zCDPにおけるρ = 0.25のプライバシー予算を達成し、予測精度に劣化がないことが実証されている。

ABSTRACT

This white paper describes recent advances in Gboard(Google Keyboard)'s use of federated learning, DP-Follow-the-Regularized-Leader (DP-FTRL) algorithm, and secure aggregation techniques to train machine learning (ML) models for suggestion, prediction and correction intelligence from many users' typing data. Gboard's investment in those privacy technologies allows users' typing data to be processed locally on device, to be aggregated as early as possible, and to have strong anonymization and differential privacy where possible. Technical strategies and practices have been established to allow ML models to be trained and deployed with meaningfully formal DP guarantees and high utility. The paper also looks ahead to how technologies such as trusted execution environments may be used to further improve the privacy and security of Gboard's ML models.

研究の動機と目的

  • Gboardのフェデレーテッドラーニングシステムにおけるユーザーのプライバシーを、複数のプライバシー強化技術を組み合わせることで向上させること。
  • ユーザーの入力パターンに基づいて訓練された言語モデルにおける、個々のユーザーのデータのモデル記憶のリスクに対処すること。
  • デバイスからサーバーまで、フェデレーテッドラーニングパイプライン全体にわたり、エンドツーエンドのプライバシー保護を実現すること。
  • モバイルMLシステムにおけるセキュアアグリゲーションおよび微分プライバシーの効率性とスケーラビリティを向上させること。
  • 将来のフェデレーテッドラーニングシステムにおける検証可能なプライバシー主張を可能にする、信頼実行環境(TEEs)の活用に向けた基盤を築くこと。

提案手法

  • モデルパラメータに対して形式的な中央微分プライバシー保証を提供するDP-FTRL(微分プライバシー付きFTRL)を用い、ユーザー単位のプライバシーを保証する。
  • セキュアアグリゲーション(SecAgg)を採用し、サーバーが誠実だが好奇心の強い場合でも、個々のモデル更新を学習できないようにする。
  • 分散型微分プライバシー(DDP)を統合し、送信前にモデル更新を摂動させることで、悪意のあるサーバーからの攻撃に対しても保護する。
  • 通信および計算のオーバーヘッドを低減するため、サブグラフ型SecAggプロトコルを適用し、大規模モデルへのスケーラビリティを向上させる。
  • デバイスレベルのアクセス制御、アテステーショントークン、APIキー認証を実装し、クライアントの整合性を保証し、ボットネットの悪用を防止する。
  • DP-FTRLとSecAgg/DDPを段階的な防御戦略として組み合わせ、モデル学習およびアグリゲーションの各段階でプライバシー境界を強化する。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、ユーザー単位の微分プライバシーをセキュアアグリゲーションと効果的に組み合わせ、モバイル言語モデルにおけるユーザー入力データを保護できるか?
  • RQ2DP-FTRLおよびSecAgg/DDPを適用した場合、Gboardの次単語予測モデルにおけるモデルの性能にどのような影響が生じるか?
  • RQ3DP-FTRLとSecAgg/DDPの組み合わせにより、モデルの正確性に劣化を来すことなく、より強力なエンドツーエンドのプライバシー保証を達成できるか?
  • RQ4数百万台のデバイスにわたり、低帯域幅および低メモリ使用量を維持したまま、プライバシー保護型フェデレーテッドラーニングを効率的にスケーリングできるか?
  • RQ5信頼実行環境(TEEs)は、将来のフェデレーテッドラーニングシステムにおける検証可能なプライバシー主張を実現するために、どのような役割を果たせるか?

主な発見

  • 2023年6月に、米国英語の次単語予測用に、DP-FTRLおよびSecAgg/DDPを併用した言語モデルの初の本番環境デプロイが実施された。
  • DP-FTRL + SecAgg/DDPの組み合わせモデルは、zCDPプライバシー予算ρ = 0.25を達成し、以前のモデル(ρ = 1.31)と比較して顕著な改善を示した。
  • DP-FTRL単体で訓練されたベースラインモデルと同等の予測ピック比率および正確性を維持しており、性能の低下がないことが示された。
  • キー単位の補正トリガーを備えたモデルは、SecAggを用いて訓練され、本番環境に正常にデプロイされ、品質に悪影響がなかった。
  • サブグラフ型SecAggプロトコルにより、約1,000~約300万パラメータのさまざまなサイズのモデルに対しても、効率的なSecAggのデプロイが可能になった。
  • 隔離境界、アクセス制御、およびメタデータおよび識別子の即時破棄を通じて、強力なデータ最小化と匿名化が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。