Skip to main content
QUICK REVIEW

[論文レビュー] Incremental Layer-wise Self-Supervised Learning for Efficient Speech Domain Adaptation On Device

Zhouyuan Huo, Dongseong Hwang|arXiv (Cornell University)|Oct 1, 2021
Speech Recognition and Synthesis参考文献 20被引用数 4
ひとこと要約

本論文は、オンデバイス音声ドメイン適応のための、段階的でレイヤー単位の自己教師あり学習アルゴリズムを提案する。1回に1つのエンコーダーレイヤーのみを更新することで、トレーニングメモリを著しく削減する。自己教師あり学習のエンドツーエンド手法に比べて89.7%少ないメモリを用いながら、教師ありベースラインに比べ24.2%の相対的WER改善を達成する。

ABSTRACT

Streaming end-to-end speech recognition models have been widely applied to mobile devices and show significant improvement in efficiency. These models are typically trained on the server using transcribed speech data. However, the server data distribution can be very different from the data distribution on user devices, which could affect the model performance. There are two main challenges for on device training, limited reliable labels and limited training memory. While self-supervised learning algorithms can mitigate the mismatch between domains using unlabeled data, they are not applicable on mobile devices directly because of the memory constraint. In this paper, we propose an incremental layer-wise self-supervised learning algorithm for efficient speech domain adaptation on mobile devices, in which only one layer is updated at a time. Extensive experimental results demonstrate that the proposed algorithm obtains a Word Error Rate (WER) on the target domain $24.2\%$ better than supervised baseline and costs $89.7\%$ less training memory than the end-to-end self-supervised learning algorithm.

研究の動機と目的

  • モバイル音声認識におけるサーバーでトリムされたデータとオンデバイス音声データの間のドメインシフトの課題に対処する。
  • オンデバイスでのトレーニングに制限されたメモリと信頼性の低いラベルの欠如という課題を克服する。
  • 段階的でレイヤー単位の更新を用いて、モバイルデバイス上で効率的な自己教師あり事前学習を可能にする。
  • 認識精度を損なわせることなく、トレーニングメモリ消費量を削減する。
  • 低リソース環境におけるオンデバイスドメイン適応に向けたレイヤー単位の自己教師あり学習の有効性を示す。

提案手法

  • 下位から順に、1回に1つまたは数個のエンコーダーレイヤーのみを段階的に更新する。
  • 選択されたレイヤーに自己教師あり損失(CPC、Wav2vec2.0、APC)を付加し、固定された下位レイヤーの勾配計算を回避する。
  • 入力シーケンスを切り詰める手法を用いてメモリ使用量を制御する。自己教師あり損失は入力とラベルのアラインメントを必要としないため、この手法が有効である。
  • まず下位レイヤーを事前学習し、その後で段階的に上位レイヤーを事前学習することで、階層的表現学習を保証する。
  • より強固な表現学習のため、将来のフレーム予測とネガティブサンプリングを用いた対照的予測コーディング(CPC)を適用する。
  • 順伝播後、固定レイヤーの活性化値を破棄することで、メモリフットプリントを最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1段階的でレイヤー単位の自己教師あり学習は、オンデバイスでのトレーニングメモリを削減しつつ、認識性能を維持できるか?
  • RQ2各レイヤーに割り当てられる事前学習ステップの分布が、ファインチューニング性能に与える影響は何か?
  • RQ31回に1つのレイヤーではなく複数のレイヤーを同時に更新することは、モデルの精度とメモリ使用量にどのような影響を与えるか?
  • RQ4入力シーケンスの切り詰めをどの程度行えば、WERの低下を最小限に抑えながらメモリ消費量を削減できるか?
  • RQ5グリーディレイヤー単位学習やエンドツーエンド自己教師あり学習と比較して、段階的でレイヤー単位のトレーニングはWERとメモリ効率の面でどのように優れているか?

主な発見

  • 段階的でレイヤー単位の(ILW)アプローチは、ターゲットドメインにおいて教師ありベースラインに比べ24.2%の相対的WER削減を達成する。
  • ILWはエンドツーエンド自己教師あり学習に比べ、トレーニングメモリを89.7%削減し、入力長100の条件下でわずか759 MBのメモリ使用量に抑える。
  • 下位レイヤーに多くのステップを割り当てて事前学習することで、ファインチューニング段階での収束が早まり、全体の効率が向上する。
  • 1ステップあたり1〜4つのレイヤーを更新するという条件でも、WERは安定して4.6%を維持する。
  • 入力シーケンスを100フレーム(85.4%の削減)に切り詰めることで、メモリ使用量は439 MBにまで低下するが、WERはわずか0.1%上昇(4.6%から4.7%)にとどまる。
  • CPCベースのILWはAPCやWav2vec2.0を上回り、ターゲットドメイン(MF)で4.6%のWERを達成する。一方、APCは全レイヤーに均一に損失を適用するため、表現崩壊を引き起こす。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。