Skip to main content
QUICK REVIEW

[論文レビュー] Supervised Contrastive Learning for Accented Speech Recognition

Tao Han, Hantao Huang|arXiv (Cornell University)|Jul 2, 2021
Speech Recognition and Synthesis参考文献 19被引用数 9
ひとこと要約

本論文では、発音の違いに影響されにくい表現を学習することで、発音の異なる話者の音声認識性能を向上させるための教師あり対照的学習フレームワークを提案する。データ拡張技術(ノイズ注入、スペクトログラム拡張、TTS-同じ文生成)を用いて同一言語的ターゲットの正例のビューを生成することで、共同学習と比較して語誤り率(WER)をゼロショットで3.66%、フルショットで3.78%低減し、予期しない発音に対してもより高い耐性を示すことを示した。

ABSTRACT

Neural network based speech recognition systems suffer from performance degradation due to accented speech, especially unfamiliar accents. In this paper, we study the supervised contrastive learning framework for accented speech recognition. To build different views (similar "positive" data samples) for contrastive learning, three data augmentation techniques including noise injection, spectrogram augmentation and TTS-same-sentence generation are further investigated. From the experiments on the Common Voice dataset, we have shown that contrastive learning helps to build data-augmentation invariant and pronunciation invariant representations, which significantly outperforms traditional joint training methods in both zero-shot and full-shot settings. Experiments show that contrastive learning can improve accuracy by 3.66% (zero-shot) and 3.78% (full-shot) on average, comparing to the joint training method.

研究の動機と目的

  • 予期しないまたは未学習の発音を持つ話者の音声認識性能の低下を解消すること。
  • アーキテクチャの変更なしに、教師あり対照的学習が発音のばらつきに対して耐性を高められるかを検討すること。
  • 音声分野における対照的学習の正例のビューを生成するために、データ拡張技術の有効性を調査すること。
  • 対照的学習が、エンドツーエンドのASRにおいて発音やデータ拡張に依存しない表現を学習できることを示すこと。
  • ゼロショットおよびフルショット設定での評価を通じて、汎化能力および適応能力を評価すること。

提案手法

  • 同じ音素や文字(同じ発音)が異なる発音で話された場合の埋め込みを近づけ、異なるクラスの埋め込みを遠ざけるように、教師あり対照的学習損失を適用する。
  • ノイズ注入、スペクトログラム拡張、TTS-同じ文生成の3つのデータ拡張技術を用い、同一の言語的ターゲットの多様な正例のビューを生成する。
  • 同じラベルのビュー同士の類似度を最大化し、他のラベルとの類似度を最小化するように、対照的損失関数を用いてモデルを学習する。
  • ネットワークアーキテクチャを変更せずに、標準的なエンドツーエンドASRモデル(例:Conformerベース)に対照的損失を統合する。
  • ラベル情報を活用して正例ペア(異なる発音での同じ音素)を定義し、無教師対照的学習で一般的な誤った負例を回避する。
  • 隠れ表現のt-SNE可視化により、同じ音素で異なる発音のサンプルがまとまっていることを定性的に検証する。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャの変更なしに、教師あり対照的学習が発音の異なる話者の音声認識に対する耐性を高められるか?
  • RQ2ノイズ、スペクトログラム、TTSといった異なるデータ拡張技術は、ASRにおける対照的学習の有用な正例のビューを生成するためにどれほど有効か?
  • RQ3対照的学習は、共同学習と比較して、発音に依存しないおよびデータ拡張に依存しない表現を学習できるか?
  • RQ4ゼロショットおよびフルショット設定において、対照的学習は共同学習に対してどれほど性能向上をもたらすか?
  • RQ5提案手法は、ノイズやリバーブといった他の耐性課題に対しても汎用的に適用可能か?

主な発見

  • 教師あり対照的学習は、ゼロショット設定で平均してWERを共同学習と比較して3.66%低減し、フルショット設定では3.78%低減した。
  • スペクトログラム拡張が最も高い改善効果を示し、ゼロショットでWERを7.39%、フルショットで7.63%絶対的に低減した。
  • TTS-同じ文生成はゼロショットでは限定的な利益(WER改善0.13%)しか示さないが、フルショットでは2.93%の改善を示し、データ量の増加に伴い効果が顕著になることが示唆された。
  • t-SNE可視化により、対照的学習が異なる発音の同じ音素のサンプルをまとめてクラスタリングしていることが確認され、発音に依存しない表現学習が実現していることが示された。
  • データ拡張を用いなくても、対照的損失そのものだけで、共同学習と比較してゼロショットで1.35%、フルショットで0.7%のWER改善が得られ、損失関数自体の内在的利点が示された。
  • すべてのデータ拡張手法を対照的学習と組み合わせた場合、共同学習と比較して最大のWER低減が得られ、ゼロショットで7.99%、フルショットで8.94%の低減が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。