Skip to main content
QUICK REVIEW

[論文レビュー] PARP: Prune, Adjust and Re-Prune for Self-Supervised Speech Recognition

Cheng-I Lai, Shuicheng Yan|arXiv (Cornell University)|Jun 10, 2021
Speech Recognition and Synthesis参考文献 124被引用数 12
ひとこと要約

PARP(Prune, Adjust, and Re-Prune)は、自己教師付き音声表現モデル向けの新しい剪定手法であり、1回のダウンストリーム微調整のみで、低リソースASR性能が向上するスパースな部分ネットワークを発見する。事前学習済みモデルを剪定し、剪定された重みを保持したまま部分ネットワークを微調整し、その後再剪定することで、10分間のLibriSpeechにおいて、フルモデルと比較して最大12.6%の相対的WER低減を達成する。

ABSTRACT

Self-supervised speech representation learning (speech SSL) has demonstrated the benefit of scale in learning rich representations for Automatic Speech Recognition (ASR) with limited paired data, such as wav2vec 2.0. We investigate the existence of sparse subnetworks in pre-trained speech SSL models that achieve even better low-resource ASR results. However, directly applying widely adopted pruning methods such as the Lottery Ticket Hypothesis (LTH) is suboptimal in the computational cost needed. Moreover, we show that the discovered subnetworks yield minimal performance gain compared to the original dense network. We present Prune-Adjust-Re-Prune (PARP), which discovers and finetunes subnetworks for much better performance, while only requiring a single downstream ASR finetuning run. PARP is inspired by our surprising observation that subnetworks pruned for pre-training tasks need merely a slight adjustment to achieve a sizeable performance boost in downstream ASR tasks. Extensive experiments on low-resource ASR verify (1) sparse subnetworks exist in mono-lingual/multi-lingual pre-trained speech SSL, and (2) the computational advantage and performance gain of PARP over baseline pruning methods. In particular, on the 10min Librispeech split without LM decoding, PARP discovers subnetworks from wav2vec 2.0 with an absolute 10.9%/12.6% WER decrease compared to the full model. We further demonstrate the effectiveness of PARP via: cross-lingual pruning without any phone recognition degradation, the discovery of a multi-lingual subnetwork for 10 spoken languages in 1 finetuning run, and its applicability to pre-trained BERT/XLNet for natural language tasks.

研究の動機と目的

  • 自己教師付き音声認識における標準的な剪定手法(OMPやIMP)の非効率さと限界のある性能向上を是正すること。
  • 低リソースASRで元の密度型モデルを上回る性能を示す、事前学習済み音声SSLモデル内にスパース部分ネットワークを発見すること。
  • 優れた性能と計算効率を達成しながら、複数の微調整サイクルを必要としない手法を開発すること。
  • 低リソース、クロスリンガル、マルチリンガルASR設定において、この手法の有効性を検証すること。
  • BERT や XLNet などのNLPモデルへのアプローチの一般化を検討すること。

提案手法

  • まず、目的のスパarsityに達するよう、マグニチュードベースの非構造的剪定を事前学習済みSSLモデルに適用し、初期部分ネットワークと剪定マスクを取得する。
  • 次に、ダウンストリームASRタスクで、剪定された部分ネットワークを微調整し、マスクに含まれる重みを含めたすべての重みが勾配によって更新されるが、マスク構造は維持する。
  • 数ステップの学習後、更新された部分ネットワークを再び同じスパarsityに剪定し、最も重要な重みのみを保持する。
  • この手法は、微調整中にわずかな調整が標準的な剪定法よりも顕著な性能向上をもたらすという洞察を活用している。
  • 複数回の微調整サイクルを必要とせず、エンドツーエンドで適用され、計算コストが削減される。
  • この手法は wav2vec 2.0、XLSR に適用され、NLPタスクの BERT/XLNet へも拡張されている。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み自己教師付き音声モデル内に、低リソースASRでフルモデルを上回る性能を示すスパース部分ネットワークが存在するか?
  • RQ21回のダウンストリーム微調整で、標準的な剪定手法よりも優れた性能を示す部分ネットワークを発見できるか?
  • RQ3PARP手法は、低リソース、クロスリンガル、マルチリンガルASR設定に一般化可能か?
  • RQ4言語固有のデータでの再トレーニングなしに、発見された部分ネットワークが性能を維持または向上できるか?
  • RQ5PARPアプローチは、BERT や XLNet などの非音声モデル、特にNLPタスクに移植可能か?

主な発見

  • PARPは、wav2vec 2.0 からスパース部分ネットワークを発見し、言語モデルデコードなしで10分間のLibriSpeechスプリットで、絶対的10.9%および12.6%のWER低減を達成した。
  • 標準的な剪定ベースライン(OMPとIMP)は、全スパarsityレベルでフルモデルと同等の性能に留まり、性能向上が見られなかったのに対し、PARPはそれを上回る性能を示した。
  • PARPは、音声認識性能の低下を伴わずクロスリンガル剪定を可能にし、言語間で堅牢であることを示した。
  • 1回の微調整サイクルで10言語のマルチリンガル部分ネットワークが発見され、スケーラビリティが裏付けられた。
  • この手法はNLPモデルへも移植可能であり、自然言語タスクにおける事前学習済みBERTとXLNetでも有効性が確認された。
  • 繰り返し剪定を必要としないため、計算コストを著しく削減し、1回のダウンストリーム微調整サイクルで十分である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。