Skip to main content
QUICK REVIEW

[論文レビュー] Predicting within and across language phoneme recognition performance of self-supervised learning speech pre-trained models

Hang Ji, Tanvina Patel|arXiv (Cornell University)|Jun 24, 2022
Speech Recognition and Synthesis被引用数 7
ひとこと要約

本論文は、CPC、wav2vec 2.0、HuBertの自己教師付き音声表現を、英語(同じ言語内)およびMboshi(異言語間)における発音的特徴(AF)抽出および発音子認識の観点から評価する。フレームレベルのAFプローブとエンドツーエンドASRを用い、AF表現の質が発音子認識精度を強く予測することを示し、HuBertが最も優れた性能を示した。英語では10.2%のPER、Mboshiでは23.0%のPERを達成。MFCCsと比較して、AFプローブではそれぞれ34.4%および26.7%の相対的改善を示した。

ABSTRACT

In this work, we analyzed and compared speech representations extracted from different frozen self-supervised learning (SSL) speech pre-trained models on their ability to capture articulatory features (AF) information and their subsequent prediction of phone recognition performance for within and across language scenarios. Specifically, we compared CPC, wav2vec 2.0, and HuBert. First, frame-level AF probing tasks were implemented. Subsequently, phone-level end-to-end ASR systems for phoneme recognition tasks were implemented, and the performance on the frame-level AF probing task and the phone accuracy were correlated. Compared to the conventional speech representation MFCC, all SSL pre-trained speech representations captured more AF information, and achieved better phoneme recognition performance within and across languages, with HuBert performing best. The frame-level AF probing task is a good predictor of phoneme recognition performance, showing the importance of capturing AF information in the speech representations. Compared with MFCC, in the within-language scenario, the performance of these SSL speech pre-trained models on AF probing tasks achieved a maximum relative increase of 34.4%, and it resulted in the lowest PER of 10.2%. In the cross-language scenario, the maximum relative increase of 26.7% also resulted in the lowest PER of 23.0%.

研究の動機と目的

  • 自己教師付き音声事前学習モデルが発音的特徴(AF)情報をどの程度捉えているかを評価すること。
  • AF表現の質と下流の発音子認識性能との相関関係を調査すること。
  • SSLモデルの同じ言語内(英語)および異言語間(Mboshi)での性能を比較すること。
  • フレームレベルのAFプローブがエンドツーエンドASR性能を予測できるかどうかを特定すること。

提案手法

  • 固定されたSSLモデル(CPC、wav2vec 2.0、HuBert)に対してフレームレベルの発音的特徴(AF)プローブタスクを適用し、その表現に含まれるAF情報の量を定量化する。
  • エンドツーエンドの自動音声認識(ASR)システムを、英語およびMboshiにおける発音子認識の目的で、SSLから得た特徴を用いて訓練する。
  • AFプローブおよびASRタスクの両方で比較のためのベースラインとしてMFCCsを用いる。
  • AFプローブ性能と発音子認識精度の間のピアソン相関を計算し、予測能力を評価する。
  • 分析には8つのAF次元のマクロ平均F1スコアと、ASRの単語レベル誤り率(WER/PER)が含まれる。
  • 実験設定では、英語用にTIMITデータセット、異言語評価用にMboshiデータセットが使用された。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 自己教師付き音声事前学習モデルがどの程度発音的特徴(AF)情報をモデル化しているか、また同じ言語(英語)における発音子認識性能とその相関関係はいかなるものか?
  • RQ2RQ2: 英語で事前学習されたSSLモデルが、別の言語(Mboshi)のAF情報をどの程度モデル化しているか、またその言語における発音子認識性能とその相関関係はいかなるものか?
  • RQ3RQ3: フレームレベルのAFプローブ性能は、同じ言語および異言語の両方のシナリオにおいて、下流の発音子認識精度を予測できるか?

主な発見

  • 同じ言語内シナリオでは、HuBertが最も高いAFプローブ性能を示し、MFCCsと比較して34.4%の相対的改善を達成した。また、発音子誤り率(PER)は最低の10.2%を記録した。
  • 異言語間シナリオでは、HuBertがMFCCsと比較してAFプローブで26.7%の相対的改善を示し、MboshiではPERが最低の23.0%を達成した。
  • 異言語間シナリオでは、AFプローブ性能と発音子認識精度の間のピアソン相関が0.990であった。これは強い予測的関係を示している。
  • CPC、wav2vec 2.0、HuBertのすべてのSSLモデルが、MFCCsよりも多くのAF情報を捉えており、同じ言語および異言語の両方の設定でMFCCsよりも低いPERを達成した。
  • 英語とMboshiの間の性能差は、Mboshiデータセットに多数の発音子と少ない発話者数があることに起因しており、認識がより困難であることが要因である。
  • HuBertの優れた性能は、表現学習を強化する疑似ラベルを提供する音声単位発見(AUD)モジュールに起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。