Skip to main content
QUICK REVIEW

[論文レビュー] Multitask-Based Joint Learning Approach To Robust ASR For Radio Communication Speech

Duo Ma, Nana Hou|arXiv (Cornell University)|Jul 22, 2021
Speech and Audio Processing参考文献 30被引用数 11
ひとこと要約

本稿では、別個の事前学習を経ずに、スピークエナーブルメント(SE)フロントエンドとエンドツーエンドASRバックエンドを同時にスクラッチから学習するマルチタスクベースの共同学習フレームワークを提案する。両方の性能を統合損失で最適化し、位相情報を保持することで、二重チャネルのデータ拡張を用いたRATS英語データセットにおいて、相対的WERを11.2%削減した。

ABSTRACT

To realize robust end-to-end Automatic Speech Recognition(E2E ASR) under radio communication condition, we propose a multitask-based method to joint train a Speech Enhancement (SE) module as the front-end and an E2E ASR model as the back-end in this paper. One of the advantage of the proposed method is that the entire system can be trained from scratch. Different from prior works, either component here doesn't need to perform pre-training and fine-tuning processes separately. Through analysis, we found that the success of the proposed method lies in the following aspects. Firstly, multitask learning is essential, that is the SE network is not only learning to produce more Intelligent speech, it is also aimed to generate speech that is beneficial to recognition. Secondly, we also found speech phase preserved from noisy speech is critical for improving ASR performance. Thirdly, we propose a dual channel data augmentation training method to obtain further improvement.Specifically, we combine the clean and enhanced speech to train the whole system. We evaluate the proposed method on the RATS English data set, achieving a relative WER reduction of 4.6% with the joint training method, and up to a relative WER reduction of 11.2% with the proposed data augmentation method.

研究の動機と目的

  • 超高周波(UHF)ラジオ通信音声において、低SNRと帯域制限によって著しく劣化した状況でも耐障害性の高いエンドツーエンドASRシステムを開発すること。
  • SEとASRの間の不一致を解消するため、SEとASRを別個に事前学習するのではなく、両者を同時に学習すること。
  • 位相の保持とデータ拡張が、極めてノイズの強いラジオ通信環境下でのASR性能に与える影響を調査すること。
  • SEとASRのコンポーネントの別個の事前学習やファインチューニングを不要とするため、エンドツーエンドの共同学習をスクラッチから可能にすること。

提案手法

  • ASR性能と音声エナーブルメント品質のバランスを取るために、(1−β)ℒASR + βℒSEという統合損失を用いたマルチタスクベースの共同学習アプローチを採用。
  • SEには時間周波数スペクトルマスク法を採用し、STFTマグニチュードを入力とし、認識性能向上のため位相情報を保持する。
  • ASR学習時にクリア音声と強化音声を組み合わせる二重チャネルデータ拡張戦略を導入し、耐障害性を向上させる。
  • エンドツーエンドASRバックエンドにはConformerアーキテクチャを採用し、80次元のlog-Mel特徴量とバイトペアエンコーディング(BPE)のトークン化を用いる。
  • 学習中にクリア音声と強化音声の寄与度をバランスさせるために、損失関数にクリアデータ重み係数γを適用する。
  • マスク推定における活性化関数としてReLU、Mish、meta-ACONを比較し、ReLUが最も優れた性能を示した。

実験結果

リサーチクエスチョン

  • RQ1極めてノイズの強いラジオ通信音声において、SEとASRをスクラッチから共同学習することで、別個の学習や事前学習を上回る性能が達成できるか?
  • RQ2強化音声における位相情報の保持は、後続のASR性能向上にとってどれほど重要か?
  • RQ3クリア音声と強化音声の両方を用いる二重チャネルデータ拡張は、低SNR環境下でのASR耐障害性をどの程度向上させるか?
  • RQ4マルチタスク損失関数におけるASRとSEの目的の最適なバランスは何か?スケーリング係数βは性能にどのように影響するか?
  • RQ5共同学習設定下で、SEマスク推定ネットワークにおけるどの活性化関数が最も優れたASR性能を達成するか?

主な発見

  • 提案されたマルチタスクベースの共同学習手法は、データ拡張なしのベースラインシステムと比較して、相対的WERを4.6%削減した。
  • 二重チャネルデータ拡張を適用した場合、ベースラインと比較して相対的WERを11.2%削減し、極めてノイズの強い環境下で顕著な性能向上を示した。
  • 強化音声における位相情報の保持は極めて重要であり、位相を省略した場合(システムS5)、WERが68.6%にまで上昇し、著しい性能劣化を示した。
  • SEモジュールのマスク推定にReLUを用いることで、最も優れたASR性能(51.8% WER)が達成され、Mish(53.3%)やmeta-ACON(52.9%)を上回った。
  • 最適なクリアデータ重み係数γは0.7であり、二重チャネルマルチタスク共同学習設定で最も低いWER(48.2%)を達成した。
  • データ拡張がなくても、マルチタスク学習と位相情報の保持により、著しい性能向上が得られ、WERは54.3%から51.8%に低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。