Skip to main content
QUICK REVIEW

[論文レビュー] Simple and Effective Zero-shot Cross-lingual Phoneme Recognition

Qiantong Xu, Alexei Baevski|arXiv (Cornell University)|Sep 23, 2021
Speech Recognition and Synthesis参考文献 35被引用数 10
ひとこと要約

本稿では、複数の訓練言語のラベル付きデータ上で多言語事前学習されたwav2vec 2.0モデル(XLSR-53)を微調整し、発音特徴を用いて未学習の対象言語への音素マッピングを行う、シンプルで効果的なゼロショット多言語音声認識手法を提案する。本手法は、フルモデル微調整と多言語事前学習を活用することで、先行研究を大きく上回り、最小限のラベル付きデータで42 CommonVoice、19 BABEL、6 MLS言語において最先端の結果を達成する。

ABSTRACT

Recent progress in self-training, self-supervised pretraining and unsupervised learning enabled well performing speech recognition systems without any labeled data. However, in many cases there is labeled data available for related languages which is not utilized by these methods. This paper extends previous work on zero-shot cross-lingual transfer learning by fine-tuning a multilingually pretrained wav2vec 2.0 model to transcribe unseen languages. This is done by mapping phonemes of the training languages to the target language using articulatory features. Experiments show that this simple method significantly outperforms prior work which introduced task-specific architectures and used only part of a monolingually pretrained model.

研究の動機と目的

  • 低リソース言語における音声認識のラベル付きデータ不足を解消するため、言語間でゼロショット転移学習を可能にする。
  • 単言語またはタスク固有のアーキテクチャではなく、多言語自己教師付き事前学習を活用することで、ゼロショット多言語音声認識を向上させる。
  • 言語固有のモデルに依存するのを減らし、未学習言語を一括して音声認識可能な単一の多言語モデルを訓練する。
  • 発音特徴に基づく効果的な音素マッピングと、多言語モデルのフル微調整を通じて、ゼロショット性能を向上させる。

提案手法

  • 複数の訓練言語のラベル付きデータ上で、多言語事前学習済みのXLSR-53 wav2vec 2.0モデルを微調整し、音声認識を実行する。
  • 発音特徴(21の属性:主分類、方法、場所、声帯的性質)を用いて、音素間のハミング距離を計算し、多言語間の音素マッピングを実現する。
  • 2種類の語彙辞書を構築する:tr2tgt(訓練音素を最も近い対象音素にマッピング)とtgt2tr(対象音素を最も近い訓練音素にマッピング)を用い、デコードに使用する。
  • 言語モデルと構築した語彙辞書を用いて、微調整済みモデルをデコードし、未学習言語の最終的な音素列を生成する。
  • 53言語で、マスクされた潜在表現に対する対照的損失関数を用い、Gumbel-Softmaxによる量子化を実施してモデルを学習する。
  • 音素化ツール(Espeak, Phonetisaurus)を用いて発音表記を生成し、性能評価には発音トークン誤り率(PTER)を用いる。

実験結果

リサーチクエスチョン

  • RQ1多言語事前学習されたwav2vec 2.0モデルは、単言語事前学習モデルの特徴抽出器のみを微調整したモデルよりも、より優れたゼロショット多言語音声認識を達成できるか?
  • RQ2特徴抽出器のみではなく、フルモデルを微調整することで、ゼロショット設定において顕著な性能向上が得られるか?
  • RQ3発音特徴に基づく音素マッピングは、推論時における未知語彙音素の処理においてどの程度有効か?
  • RQ4多言語事前学習は、単言語事前学習と比較して、多様な言語においてゼロショット多言語音声認識で優れた性能を示すか?

主な発見

  • 提案手法は、単一言語事前学習済みwav2vec 2.0モデルの特徴抽出器のみを用いた先行手法を上回り、CommonVoiceで合計149時間のラベル付きデータでの平均PTERが22.2%にまで低下した。
  • 多言語事前学習(XLSR-53)により、CommonVoiceにおける平均PTERは22.2%に低下したのに対し、単言語事前学習(w2v LV-60K)では46.5%にとどまり、多言語表現の優位性が明確に示された。
  • 6言語のBABEL言語(317時間)でのXLSR-53のフル微調整は、約1,500時間のデータで学習された先行手法を上回り、高い効率性を示した。
  • tr2tgt語彙辞書構築戦略は24.5%の平均PTERを達成し、tgt2tr戦略の24.6%をわずかに上回った。両者とも、Phonetisaurusなどの音素化ツール(31.7%および32.4%)を上回った。
  • 本モデルは、非教師あり音声認識手法と比較して競争力のある性能を発揮し、単一の統合モデルで複数の未学習言語を効果的に音声認識可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。