Skip to main content
QUICK REVIEW

[論文レビュー] Perceptual Loss with Recognition Model for Single-Channel Enhancement and Robust ASR

Peter Plantinga, Deblin Bagchi|arXiv (Cornell University)|Dec 11, 2021
Speech and Audio Processing被引用数 8
ひとこと要約

本論文では、音声認識(ASR)のためのロバストな単一チャネル音声強調を向上させるために、事前学習済み音声モデルに基づく知覚的損失を提案する。生のスペクトルエネルギーではなく、発音構造の認識を活用することで、歪みを低減しつつ、最先端の強調スコアを維持し、Voicebank+DEMANDで2.80%のWERを達成した。これは共同学習と比較して20%以上、歪みに依存しない学習と比較して14%以上の相対的改善を示した。

ABSTRACT

Single-channel speech enhancement approaches do not always improve automatic recognition rates in the presence of noise, because they can introduce distortions unhelpful for recognition. Following a trend towards end-to-end training of sequential neural network models, several research groups have addressed this problem with joint training of front-end enhancement module with back-end recognition module. While this approach ensures enhancement outputs are helpful for recognition, the enhancement model can overfit to the training data, weakening the recognition model in the presence of unseen noise. To address this, we used a pre-trained acoustic model to generate a perceptual loss that makes speech enhancement more aware of the phonetic properties of the signal. This approach keeps some benefits of joint training, while alleviating the overfitting problem. Experiments on Voicebank + DEMAND dataset for enhancement show that this approach achieves a new state of the art for some objective enhancement scores. In combination with distortion-independent training, our approach gets a WER of 2.80\% on the test set, which is more than 20\% relative better recognition performance than joint training, and 14\% relative better than distortion-independent mask training.

研究の動機と目的

  • 共同音声強調とASR学習における歪み問題に対処する。すなわち、強調モデルが訓練データに過学習し、認識に役立たない歪みを導入する問題を解消する。
  • 完全な共同学習を伴わずにASRのための音声強調を向上させ、モジュラリティを保ちつつ認識性能を維持する。
  • 知覚的損失が発音構造に基づくか、従来のスペクトル損失やL1損失と比較して、低エネルギーの発音を強調する際の性能が優れているかどうかを検証する。
  • 公開済みデータセットを用いて、知覚的損失学習を共同学習および歪みに依存しない学習と直接比較することで、手法の一般性と再現可能性を示す。
  • 公開済みデータセット上で、知覚的損失学習を共同学習および歪みに依存しない学習と直接比較する。

提案手法

  • 本手法は、事前学習済み音声モデルを用いて、発音内容を保持するように強調ネットワークをガイドする知覚的損失を生成する。特に低エネルギーの発音の保持に有効である。
  • 知覚的損失は、綺麗な音声と強調された音声の下流の隠れ層活性化のL1距離として計算され、強調ネットワークが綺麗な音声の表現を模倣するよう促す。
  • 強調モデルは、この知覚的損失と標準的なL1スペクトルマグニチュード損失を組み合わせたハイブリッド損失で訓練され、知覚的忠実度と信号再構成のバランスを取る。
  • 評価は、Voicebank+DEMANDデータセットを用い、客観的な強調指標と、ノイズありデータで学習した認識モデルを用いたエンドツーエンドのASR性能で実施した。
  • 知覚モデルに局所的コンテキスト窓を導入するバリエーションを検討したところ、性能が向上し、CHiME-2で現在の最先端スコアに達した。
  • 本手法はSpeechBrainツールキットに実装されており、再現性と再利用を目的として、公開済みのレシピと事前学習済みモデルが提供されている。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み音声モデルを用いて知覚的損失を生成することで、共同学習や歪みに依存しない学習と比較して、ロバストなASRのための音声強調が向上するか?
  • RQ2知覚的損失は、高エネルギーの発音と比較して、低エネルギーの発音の認識にどのように影響を与えるか?
  • RQ3発音構造に基づく知覚的損失は、認識性能を損なう歪みを引き起こす強調ネットワークの歪みを低減できるか?
  • RQ4知覚モデルにおけるアーキテクチャ的選択(例:コンテキストサイズ、入力タイプ)が、強調品質および認識精度に最もどのように影響を与えるか?
  • RQ5提案手法は、客観的な強調指標およびエンドツーエンドのASR性能で最先端の性能を達成しつつ、モジュラリティと再現可能性を保つことができるか?

主な発見

  • 提案された知覚的損失手法は、Voicebank+DEMANDデータセットでテスト時に2.80%のWERを達成した。これは共同学習と比較して20%以上、歪みに依存しない学習と比較して14%以上の相対的改善を示した。
  • 本手法は、Voicebank+DEMANDで最先端の客観的強調スコアを達成し、4.40 CSIG、3.75 COVL、3.52 CBAKを記録した。これは、知覚的に重要な指標において、多数の先行手法を上回った。
  • 知覚的損失は、特に低エネルギーの発音を保持する点で顕著に有効であった。損失がエネルギー差ではなく発音構造に焦点を当てるため、従来のスペクトル損失が歪みを引き起こしやすい部分を効果的に制御した。
  • 知覚モデルに局所的コンテキスト窓を導入することで性能が向上し、CHiME-2で現在の最先端の認識スコアに達した。これにより、本手法の強靭性と適応性が示された。
  • 認識モデルをノイズありデータでのみ学習した場合でも、知覚的損失の追加により、テストセットのWERが3.43%から3.34%に改善された。これは、強調出力の歪みが低減したことを示している。
  • 本手法は、共同学習で一般的に見られる過学習の問題を回避し、強調と認識の学習を分離しつつも、認識に有利な出力を強調ネットワークが指向するようガイドした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。