Skip to main content
QUICK REVIEW

[論文レビュー] Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling

Peidong Wang, Ke Tan|arXiv (Cornell University)|Mar 11, 2019
Speech and Audio Processing参考文献 32被引用数 4
ひとこと要約

本稿では、モノラル音声強調と自動音声認識(ASR)の間のギャップを埋めるために、歪みに依存しない音声モデル化を提案する。強調処理に起因する歪みは一般的にASR性能を低下させる。本手法は、ノイズ、リバーブ、強調アーティファクトを含む多様な歪みで音声モデルを学習することで、未学習の歪みにも一般化可能となり、CHiME-2で9.2%の最先端のWERを達成した。これは先行システムより相対的に6.5%改善され、複数の強調フロントエンドにわたり高い耐障害性を示した。

ABSTRACT

Monaural speech enhancement has made dramatic advances since the introduction of deep learning a few years ago. Although enhanced speech has been demonstrated to have better intelligibility and quality for human listeners, feeding it directly to automatic speech recognition (ASR) systems trained with noisy speech has not produced expected improvements in ASR performance. The lack of an enhancement benefit on recognition, or the gap between monaural speech enhancement and recognition, is often attributed to speech distortions introduced in the enhancement process. In this study, we analyze the distortion problem, compare different acoustic models, and investigate a distortion-independent training scheme for monaural speech recognition. Experimental results suggest that distortion-independent acoustic modeling is able to overcome the distortion problem. Such an acoustic model can also work with speech enhancement models different from the one used during training. Moreover, the models investigated in this paper outperform the previous best system on the CHiME-2 corpus.

研究の動機と目的

  • モノラル音声強調とASRの間の継続的な性能ギャップに対処すること。強調処理後の音声は、歪みのため認識性能が向上しないことが一般的である。
  • さまざまな歪みに対して不変であるように学習された音声モデルが、訓練時に未遭遇した強調アーティファクトにも一般化できるかどうかを調査すること。
  • 異なる音声強調フロントエンドおよびノイズ条件において、歪みに依存しない音声モデル化の有効性を評価すること。
  • 特にリバーブやノイズが多い環境下で、CHiME-2ベンチマークにおいて先行システムを上回ること。
  • 大規模な多様な歪みの学習により、未訓練の歪み(異なる強調モデルからのものも含む)にも一般化可能であることを示すこと。

提案手法

  • 本研究では、10,000種類の多様なノイズタイプ(加法的ノイズ、リバーブ(RIR)、強調アーティファクトを含む)で汚染された音声の大規模データセットを用いて音声モデルを学習する。
  • すべての歪みを学習分布の一部として扱い、クリアな音声や特定の強調出力に依存しない、歪みに依存しない音声モデル化アプローチを導入する。
  • 文脈依存の再帰的ドロップアウトを文単位で適用することで、系列レベルの変動に対する一般化性能と耐障害性を向上させる。
  • ノイズに依存しない、リバーブに依存しない、歪みに依存しない、その他のモデルタイプの5種類の音声モデルを、さまざまな強調条件下で比較する。
  • CHiME-2およびADTデータセットにおいて、LSTM、CRN、IRMの複数の強調フロントエンドを用い、主にWERを指標としてモデルを評価する。
  • 話者適応を明示的に回避することで、認識性能に与える歪み耐性の影響を明確に分離する。

実験結果

リサーチクエスチョン

  • RQ1広範な歪みに対して不変であるように学習された音声モデルは、訓練時に未確認の強調処理に起因する歪みに対しても一般化できるか?
  • RQ2強調処理後の音声を用いる場合、歪みに依存しない音声モデル化は、従来のノイズ依存型やリバーブ依存型モデルを上回る性能を示すか?
  • RQ31つの歪みに依存しない音声モデルが、訓練時に使用されたモデルとは異なる複数の音声強調フロントエンドに対しても効果的に機能するか?
  • RQ4多様な歪みを大規模に学習することで、実世界のASRシナリオにおける未訓練の歪みへの一般化性能がどの程度向上するか?
  • RQ5CHiME-2ベンチマークにおいて、歪みに依存しないモデル化の性能は、先行の最先端システムと比較してどの程度優れているか?

主な発見

  • 歪みに依存しない音声モデルは、CHiME-2コーパスで平均9.2%のWERを達成し、以前の最良システムを相対的に6.5%改善した。
  • ノイズに依存する音声モデルも平均8.7%のWERを達成し、これも既存の最先端システムを上回った。
  • 9dBおよび3dB SNR条件下では、歪みに依存しないモデルを用いた強調処理後の音声が、強調処理なしの音声よりも低いWERを示した。これは、強力な音声モデル化と組み合わせた場合に強調処理が有効であることを確認した。
  • 歪みに依存しないモデルは、LSTM、CRN、IRMの複数の強調フロントエンドにおいて良好な性能を示し、さまざまなタイプの強調アーティファクトへの一般化を示した。
  • 訓練時に未学習の歪み(RIRの不一致、未確認の強調手法など)に対しても一般化でき、強力な耐障害性を示した。
  • リバーブ音声で平均3.4%のWERを達成したが、これは歪み不変学習が困難な音響環境でも効果的な認識を可能にすることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。