Skip to main content
QUICK REVIEW

[論文レビュー] Federated Transfer Learning with Dynamic Gradient Aggregation

Dimitrios Dimitriadis, Kenichi Kumatani|arXiv (Cornell University)|Aug 6, 2020
Speech Recognition and Synthesis参考文献 30被引用数 8
ひとこと要約

本稿では、音声認識用に、階層的最適化方式と動的勾配集約(DGA)アルゴリズムを導入したフェデレーテッド転移学習(FTL)プラットフォームを提案する。DGAアルゴリズムは、データ品質に基づいて勾配に重みを付ける。この手法により、収束が最大7倍速くなり、LibriSpeechでは語誤り率(WER)が6%低下し、セッション適応タスクでは20%低下する。中央集権的およびベースラインのFL手法を上回り、勾配更新のデータ駆動型正則化により、より高い収束性と耐性を実現する。

ABSTRACT

In this paper, a Federated Learning (FL) simulation platform is introduced. The target scenario is Acoustic Model training based on this platform. To our knowledge, this is the first attempt to apply FL techniques to Speech Recognition tasks due to the inherent complexity. The proposed FL platform can support different tasks based on the adopted modular design. As part of the platform, a novel hierarchical optimization scheme and two gradient aggregation methods are proposed, leading to almost an order of magnitude improvement in training convergence speed compared to other distributed or FL training algorithms like BMUF and FedAvg. The hierarchical optimization offers additional flexibility in the training pipeline besides the enhanced convergence speed. On top of the hierarchical optimization, a dynamic gradient aggregation algorithm is proposed, based on a data-driven weight inference. This aggregation algorithm acts as a regularizer of the gradient quality. Finally, an unsupervised training pipeline tailored to FL is presented as a separate training scenario. The experimental validation of the proposed system is based on two tasks: first, the LibriSpeech task showing a speed-up of 7x and 6% Word Error Rate reduction (WERR) compared to the baseline results. The second task is based on session adaptation providing an improvement of 20% WERR over a competitive production-ready LAS model. The proposed Federated Learning system is shown to outperform the golden standard of distributed training in both convergence speed and overall model performance.

研究の動機と目的

  • 実世界の音声認識で一般的な、異種的かつ非i.i.d.なデータ分布を有するフェデレーテッド環境において、頑健な音響モデルを訓練する課題に対処すること。
  • データの不均衡およびプライバシー制約の下でも、自動音声認識(ASR)のフェデレーテッドラーニングにおける収束速度とモデル性能を向上させること。
  • データ品質に基づいて勾配を動的に重み付ける新しい勾配集約メカニズムを開発し、劣悪な更新を抑制する正則化として機能させること。
  • 合成(TTS)および実際の音声データを用いて、カーリュレーションフォーゲティングを最小限に抑えるフェデレーテッド環境下での有効な非教師付きモデル適応を可能にすること。
  • 階層的最適化を備えたモジュラでスケーラブルなFLプラットフォームを用いた、ASRにおけるエンドツーエンドのフェデレーテッドトレーニングパイプラインを実証すること。

提案手法

  • 複数段階のモデル適応に対応する柔軟かつ効率的なトレーニングパイプライン構成を可能にする、階層的最適化フレームワークを導入する。
  • データ駆動的品質推定からサンプルレベルの重みを推定する、動的勾配集約(DGA)アルゴリズムを提案する。
  • DGAメカニズムは、品質が低いデータバッチからの勾配を低減することで、正則化として機能し、耐性と収束性を向上させる。
  • 二段階の非教師付きトレーニングパイプラインを実装する:まず、TTS合成を用いてシードモデルをテナント固有のテキストデータに適応させる。次に、プレゼンテーション音声を用いてフェデレーテッドラーニングで微調整する。
  • 第二段階では、サーバー側で実際の音声データを統合し、合成TTSデータへの過剰適合を防ぐために正則化を行う。
  • プラットフォームはモジュラなタスク拡張をサポートし、LASおよびRNN-Tスタイルのモデルを用いて、教師ありのLibriSpeechおよび非教師付きのセッション適応タスクの両方で評価される。

実験結果

リサーチクエスチョン

  • RQ1異種的かつ非i.i.d.なデータ分布を有する自動音声認識に、フェデレーテッドラーニングを効果的に適用できるか?
  • RQ2フェデレーテッドラーニングにおける勾配集約を、データ品質に適応させることで、収束性とモデル耐性を向上させられるか?
  • RQ3合成TTSデータを、カーリュレーションフォーゲティングを引き起こさずに、フェデレーテッド微調整に効果的に使用できるか?
  • RQ4階層的トレーニングパイプラインは、音声認識のフェデレーテッドセッション適応において性能を向上させられるか?
  • RQ5動的勾配重み付けは、標準のFedAvgおよびBMUFベースラインと比較して、収束速度および語誤り率(WER)に顕著な改善をもたらすか?

主な発見

  • 提案されたDGAアルゴリズムは、FedAvgやBMUFなどのベースライン分散およびフェデレーテッドトレーニング手法と比較して、トレーニング収束を最大7倍速めた。
  • LibriSpeechベンチマークでは、ベースラインと比較して語誤り率(WER)を6%低減し、モデルの正確性が向上したことを示した。
  • セッション適応タスクにおいて、階層的非教師付きトレーニングパイプラインは、プロダクション用LASモデルと比較して20%の相対的WER改善を達成した。
  • サーバー側のトレーニング段階で実際の音声データを統合したことで、モデルのずれと合成TTSデータへの過剰適合が顕著に減少し、一般化性能が向上した。
  • 動的勾配集約メカニズムは、特にデータが少ないまたはノイズの多い条件下で、劣悪な勾配を低減することで、効果的にトレーニングを正則化した。
  • FTLプラットフォームは、フェデレーテッド環境下でseq2seqモデルのエンドツーエンドトレーニングを成功裏に実現し、多様なASRシナリオへのスケーラビリティと適応性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。