Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting Adapters for Cross-lingual Low-resource Speech Recognition

Wenxin Hou, Zhu Han|arXiv (Cornell University)|May 18, 2021
Speech Recognition and Synthesis被引用数 9
ひとこと要約

本論文では、メタラーニングとアテンション駆動型類似性モデリングをそれぞれ活用することで、パラメータ効率的でアダプタベースのメソッド、MetaAdapter および SimAdapter を提案する。5つの低リソース言語における実験では、完全微調整の trainable パrameter のそれぞれ 2.5% および 15.5% のみを用いて、WER が 2.98% および 2.55% 相対的に低減され、統合により最大 3.55% 相対的な WER 改善が達成された。

ABSTRACT

Cross-lingual speech adaptation aims to solve the problem of leveraging multiple rich-resource languages to build models for a low-resource target language. Since the low-resource language has limited training data, speech recognition models can easily overfit. In this paper, we propose to use adapters to investigate the performance of multiple adapters for parameter-efficient cross-lingual speech adaptation. Based on our previous MetaAdapter that implicitly leverages adapters, we propose a novel algorithms called SimAdapter for explicitly learning knowledge from adapters. Our algorithm leverages adapters which can be easily integrated into the Transformer structure.MetaAdapter leverages meta-learning to transfer the general knowledge from training data to the test language. SimAdapter aims to learn the similarities between the source and target languages during fine-tuning using the adapters. We conduct extensive experiments on five-low-resource languages in Common Voice dataset. Results demonstrate that our MetaAdapter and SimAdapter methods can reduce WER by 2.98% and 2.55% with only 2.5% and 15.5% of trainable parameters compared to the strong full-model fine-tuning baseline. Moreover, we also show that these two novel algorithms can be integrated for better performance with up to 3.55% relative WER reduction.

研究の動機と目的

  • 限られた学習データによる過学習の課題に対処すること。
  • パラメータ効率的な微調整のためのアダプタを活用して、クロスリンガル転送の効率を向上させること。
  • アテンション機構を用いて、ソース言語とターゲット言語間の言語的類似性を明示的にモデリングすること。
  • メタラーニングと類似性ベースの適応を統合して、性能を向上させること。
  • 低リソース環境におけるパラメータ効率性、学習速度、推論遅延を評価すること。

提案手法

  • MetaAdapter は、モデルに依存しないメタラーニング(MAML)を用い、言語間で転送可能な音声表現を暗黙的に学習する。
  • SimAdapter は、微調整中に複数のソースアダプタを統合するアテンション機構を用いて、クロスリンガル類似性を明示的にモデリングする。
  • 両手法とも、主モデルのバックボーンを固定し、アダプタパラメータのみを微調整するため、Transformer エンコーダーおよびデコーダー層にアダプタを挿入する。
  • SimAdapter では、訓練中にアテンションがターゲット言語アダプタに焦点を当てるよう促すためのガイド損失を導入する。
  • これらの手法は相互に互換性があり、併用することでさらなる性能向上が可能である。
  • アブレーションスタディにより、異なるアダプタ層と統合戦略の寄与度が評価されている。
Figure 1: Illustration of the cross-lingual speech recognition task. Given three rich-resource languages as source languages (Italian, Welsh, and Russian), how to learn the transferable knowledge from them to build cross-lingual ASR models for the target language Romanian?
Figure 1: Illustration of the cross-lingual speech recognition task. Given three rich-resource languages as source languages (Italian, Welsh, and Russian), how to learn the transferable knowledge from them to build cross-lingual ASR models for the target language Romanian?

実験結果

リサーチクエスチョン

  • RQ1メタラーニングに基づくアダプタ適応は、極めて低リソースな言語において性能を向上させることができるか?
  • RQ2アテンションを用いてソース言語とターゲット言語間の言語的類似性を明示的にモデリングすることは、クロスリンガル ASR の性能向上に寄与するか?
  • RQ3異なるエンコーダーおよびデコーダー層におけるアダプタ統合の性能はどのように変化するか?
  • RQ4アダプタベースのクロスリンガル適応において、パラメータ効率性、学習速度、推論遅延のトレードオフはどのようなものか?
  • RQ5MetaAdapter と SimAdapter を組み合わせることで、単独での使用よりも優れた性能が得られるか?

主な発見

  • MetaAdapter は、完全微調整と比較して WER を 2.98% 相対的に低減しながら、trainable パrameter の 2.5% のみを用いた。
  • SimAdapter は、完全微調整ベースラインの trainable パrameter の 15.5% を使用して、WER を 2.55% 相対的に低減した。
  • MetaAdapter と SimAdapter の統合により、最大 3.55% 相対的な WER 改善が達成され、相補的な利点が示された。
  • より多くの層でアダプタを統合するほど性能が向上する傾向にあるが、ブレトン語のような一部の言語では、下位層でのみ統合しても十分な性能が得られる。
  • MetaAdapter は完全微調整と比較して学習時間を 43.48% 減少させたが、SimAdapter は推論 RTF を 22.12% 増加させたが、依然として許容範囲内であった。
  • アテンションマップの結果、ガイド損失を導入した SimAdapter の層は、訓練が進むにつれてターゲットアダプタに焦点を当てるようになることが確認され、効果的な知識蒸留が行われていることが示された。
Figure 2: Illustration of the MetaAdapter and SimAdapter module injected in the Speech-Transformer. Note that the residual connection between the feed-forward layer and layer normalization only applies to the SimAdapter.
Figure 2: Illustration of the MetaAdapter and SimAdapter module injected in the Speech-Transformer. Note that the residual connection between the feed-forward layer and layer normalization only applies to the SimAdapter.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。