Skip to main content
QUICK REVIEW

[論文レビュー] Joint Training of Speech Enhancement and Self-supervised Model for Noise-robust ASR

Qiushi Zhu, Jie Zhang|arXiv (Cornell University)|May 26, 2022
Speech and Audio Processing被引用数 8
ひとこと要約

本論文は、ノイズに強い自動音声認識(ASR)を実現するため、音声強調(SE)と自己教師付き表現学習(例:wav2vec2.0)を同時に最適化する共同事前学習フレームワークを提案する。ノイズ混在波形と強調出力を用いて、二重アテンション統合モジュールを介して共同学習することで、音声歪みを低減し、実世界のノイズ混在データセットにおいて、検証時で8.2、テスト時で14.3という最先端のWED(語誤り率)を達成した。これは、慎重な初期化を要する手法を含む先行研究を上回る結果である。

ABSTRACT

Speech enhancement (SE) is usually required as a front end to improve the speech quality in noisy environments, while the enhanced speech might not be optimal for automatic speech recognition (ASR) systems due to speech distortion. On the other hand, it was shown that self-supervised pre-training enables the utilization of a large amount of unlabeled noisy data, which is rather beneficial for the noise robustness of ASR. However, the potential of the (optimal) integration of SE and self-supervised pre-training still remains unclear. In order to find an appropriate combination and reduce the impact of speech distortion caused by SE, in this paper we therefore propose a joint pre-training approach for the SE module and the self-supervised model. First, in the pre-training phase the original noisy waveform or the waveform obtained by SE is fed into the self-supervised model to learn the contextual representation, where the quantified clean speech acts as the target. Second, we propose a dual-attention fusion method to fuse the features of noisy and enhanced speeches, which can compensate the information loss caused by separately using individual modules. Due to the flexible exploitation of clean/noisy/enhanced branches, the proposed method turns out to be a generalization of some existing noise-robust ASR models, e.g., enhanced wav2vec2.0. Finally, experimental results on both synthetic and real noisy datasets show that the proposed joint training approach can improve the ASR performance under various noisy settings, leading to a stronger noise robustness.

研究の動機と目的

  • ノイズ環境下における音声強調(SE)と自動音声認識(ASR)の間のマッチングの不一致を是正する。
  • SEと自己教師付きモデルを別々に学習するのではなく、共同事前学習によりASRのノイズ耐性を向上させる。
  • 適切なモデル初期化に依存しないようにし、ランダム重みからの有効な学習を可能にする。
  • ノイズ混在、強調済み、クリアな音声の各ブランチ間の情報統合を促進し、歪みを低減するとともにASR性能を向上させる。
  • 複数の入力ブランチ(ノイズ混在、強調済み、クリア)を柔軟に活用できるように、既存のノイズ耐性ASRモデルを一般化する。

提案手法

  • 元のノイズ混在波形とSEによる強調波形を入力とし、対照的学習のターゲットとして量子化済みクリア音声を用いて、自己教師付きモデル(例:wav2vec2.0)を共同で事前学習する。
  • ノイズ混在および強調済み音声ブランチからの特徴を統合する二重アテンション統合モジュールを導入し、クロスアテンションにより情報損失を補償する。
  • ラベルなしデータから離散的音声ユニットを学習するために、ベクトル量子化(VQ)操作を適用し、ノイズ環境下での表現品質を向上させる。
  • クリア音声とノイズ混在音声の特徴間に一貫性損失を適用し、表現を整列させ、ノイズ耐性を強化する。
  • SEモジュールと自己教師付きモデルを統一された目的関数でエンドツーエンドに学習させ、別々の最適化が引き起こす歪みを回避する。
  • モデル全体をランダム初期化可能とし、最適化理論を用いて収束性と歪み低減を検証する。

実験結果

リサーチクエスチョン

  • RQ1SEと自己教師付きモデルの共同事前学習は、ノイズ環境下での音声歪み低減とASR性能向上に寄与するか?
  • RQ2ノイズ混在および強調済み音声特徴の二重アテンション統合は、単独で使用するいずれかのブランチと比較して、ASRの耐性にどのように寄与するか?
  • RQ3本手法は、先行研究が慎重な初期化を要するのに対し、ランダム初期化でも高い性能を維持するか?
  • RQ4VQ操作とクリア・ノイズ特徴間の一貫性損失の導入は、実世界のノイズ環境下でのノイズ耐性をどの程度向上させるか?
  • RQ5本手法の共同フレームワークは、強調済みwav2vec2.0などの既存のノイズ耐性ASRモデルに一般化可能か?

主な発見

  • 提案手法は、dt05_real検証セットで語誤り率(WER)8.2、et05_realテストセットで14.3を達成し、ベースラインのEW2モデル(WER 9.4および15.6)と比較して約10%の相対的改善を示した。
  • Transformerベースの言語モデルを組み合わせた場合でも、提案手法は一貫した性能向上を示し、外部言語モデル統合時においても共同学習の有効性を裏付けた。
  • 複雑なデータ拡張や補助処理を要しないにもかかわらず、[15](WER 3.5/6.8)や[40](WER 2.8/5.8)といった最先端の教師あり手法を上回る結果を達成し、競争力のある性能を発揮した。
  • ランダム初期化でも安定した性能を維持し、性能低下が最小限に抑えられた。これは、先行手法が収束させるために慎重な初期化を要するのとは対照的である。
  • 二重アテンション統合モジュールは、合成および実世界のノイズ混在データセットにおいて、WEDの向上を通じて情報損失と音声歪みの低減を効果的に実現した。
  • VQ操作とクリア・ノイズ特徴間の一貫性損失の導入により、実世界の実用的ノイズ環境下でのノイズ耐性が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。