Skip to main content
QUICK REVIEW

[論文レビュー] Federated Learning for Keyword Spotting

David Leroy, Alice Coucke|arXiv (Cornell University)|Oct 9, 2018
Privacy-Preserving Technologies in Data参考文献 16被引用数 7
ひとこと要約

本論文では、Adamにインspiredされた適応的平均化を用いたフェデレーテッドラーニング手法を提案し、分散型でユーザーが所有する音声データ上で軽量なウェイクワード検出器を学習する。100回の通信ラウンドで5 FAHにおける再現率95%を達成し、1ユーザーあたり上行通信量が8 MBにとどまり、学習時間を顕著に短縮するとともに、プライバシーを保護する。

ABSTRACT

We propose a practical approach based on federated learning to solve out-of-domain issues with continuously running embedded speech-based models such as wake word detectors. We conduct an extensive empirical study of the federated averaging algorithm for the "Hey Snips" wake word based on a crowdsourced dataset that mimics a federation of wake word users. We empirically demonstrate that using an adaptive averaging strategy inspired from Adam in place of standard weighted model averaging highly reduces the number of communication rounds required to reach our target performance. The associated upstream communication costs per user are estimated at 8 MB, which is a reasonable in the context of smart home voice assistants. Additionally, the dataset used for these experiments is being open sourced with the aim of fostering further transparent research in the application of federated learning to speech data.

研究の動機と目的

  • スピークャーおよび録音のばらつきによる、埋め込み型ウェイクワード検出器におけるドメイン外性能の問題を解決すること。
  • 中央集権的な音声データの集約を避け、ユーザー所有の音声データ上でウェイクワード検出器を学習可能にし、ユーザーのプライバシーを保護すること。
  • 音声アプリケーションにおけるフェデレーテッドラーニングの通信コストと収束時間の低減を図ること。
  • 非i.i.d.な音声ベースのフェデレーテッドラーニングにおいて、Adamにインspiredされたパラメータごとの適応的平均化(adaptive per-parameter averaging)が、標準的なFedAvgよりも優れていることを実証すること。

提案手法

  • 著者らは、ユーザー端末上で中規模のニューラルネットワーク(200kパラメータ、20 MFLOPSの計算制約)を用いてローカルモデルを学習するフェデレーテッド平均化フレームワークを採用している。
  • 標準的なグローバルモデル平均化の代わりに、Adamオプティマイザにインspiredされた、パラメータごとに異なる学習率を用いる適応的平均化ルールを導入し、収束性を向上させている。
  • 中央集権的なパラメータサーバーが、各通信ラウンドでクライアントの更新を集約しており、負荷軽減のためクライアントはランダムに選択(10%の参加率)されている。
  • ローカル学習は固定されたローカル学習率0.01で実行され、収束性と通信効率のバランスを取るために、ローカルエポック数(E)とバッチサイズ(B)が最適化されている。
  • データセットはクラウドソーシングされ、公開リリースされており、フェデレーテッド音声学習分野における再現可能性研究を支援している。
  • モデル評価は開発セットおよびテストセットで実施され、再現率と1時間あたりの誤検出率(FAH)などの指標が用いられている。
Fig. 1 : Effect of the share of users involved in each round C on the dev set recall / 5 FAH, FedSGD , Adam global averaging, $\eta_{global}=0.001,\eta_{local}=0.01$
Fig. 1 : Effect of the share of users involved in each round C on the dev set recall / 5 FAH, FedSGD , Adam global averaging, $\eta_{global}=0.001,\eta_{local}=0.01$

実験結果

リサーチクエスチョン

  • RQ1Adamにインspiredされた適応的平均化は、標準的なFedAvgと比較して、フェデレーテッドキーワードスティングにおいて収束速度を向上させるか?
  • RQ2実際のユーザー参加率を想定した状況下で、適応的平均化を用いたウェイクワード検出器のフェデレーテッドトレーニングにおける通信コストはどの程度か?
  • RQ3非i.i.d.なフェデレーテッド環境下で、異なるデータ分布およびユーザー固有の音声特性に対してモデル性能はどのように変動するか?
  • RQ4この設定下で、ローカル学習の深さ(エポック数およびバッチサイズ)が収束性と通信効率に与える影響はどの程度か?
  • RQ5プライバシー保護型のフェデレーテッドラーニングアプローチは、実世界の音声検出タスクにおいて高い再現率と低い誤検出率を達成できるか?

主な発見

  • Adamにインspiredされた適応的平均化を用いることで、5 FAHにおける95%再現率に到達するための通信ラウンド数が、標準的なFedAvgを用いた場合の400ラウンド以上から、わずか100ラウンドにまで削減された。
  • 最良のモデルは、ネガティブテストデータで3.2 FAH、Librispeechで3.9 FAH、社内ニュースおよびテレビデータセットで0.2–0.6 FAHの誤検出率を達成し、95%の再現率を維持した。
  • 100ラウンドで収束した場合の1ユーザーあたりの上行通信コストは8 MBと推定された。400ラウンドまでトレーニングが延長された場合は32 MBに上昇した。
  • 最適な設定ではE=1のローカルエポックとB=20のバッチサイズを採用し、同程度の収束性を示すFedSGDと比較して80%の高速化が達成された。
  • グローバル平均化に学習率1.0を用いた場合、400ラウンドで再現率は67.3%にとどまったが、η_global=0.001で適応的平均化を用いた場合、再現率は98.29%に達した。
  • 本研究では、ローカル学習ステップの増加が収束速度に与える影響は限定的であった一方で、ローカルおよびグローバル学習率のチューニングが性能に顕著な影響を与えたことが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。