Skip to main content
QUICK REVIEW

[論文レビュー] Enhancement and Recognition of Reverberant and Noisy Speech by Extending Its Coherence

Scott Wisdom, Thomas A. Powers|arXiv (Cornell University)|Sep 2, 2015
Speech and Audio Processing参考文献 27被引用数 13
ひとこと要約

本稿では、短時間ファンチルプ変換(STFChT)を用いて分析窓長を拡張することで、混响およびノイズの強い音声を向上させる手法を提案している。STFChTは、時間変化する基本周波数をモデル化し、標準的なSTFTよりも長い期間にわたって整合性を保つ。この手法は、PESQなどの客観的音声品質で優れた結果を達成するが、長窓STFTと比較して語彙誤り率(WER)が低くなる傾向にあり、音声強調品質とASR性能の間にはトレードオフがあることが示唆される。

ABSTRACT

Most speech enhancement algorithms make use of the short-time Fourier transform (STFT), which is a simple and flexible time-frequency decomposition that estimates the short-time spectrum of a signal. However, the duration of short STFT frames are inherently limited by the nonstationarity of speech signals. The main contribution of this paper is a demonstration of speech enhancement and automatic speech recognition in the presence of reverberation and noise by extending the length of analysis windows. We accomplish this extension by performing enhancement in the short-time fan-chirp transform (STFChT) domain, an overcomplete time-frequency representation that is coherent with speech signals over longer analysis window durations than the STFT. This extended coherence is gained by using a linear model of fundamental frequency variation of voiced speech signals. Our approach centers around using a single-channel minimum mean-square error log-spectral amplitude (MMSE-LSA) estimator proposed by Habets, which scales coefficients in a time-frequency domain to suppress noise and reverberation. In the case of multiple microphones, we preprocess the data with either a minimum variance distortionless response (MVDR) beamformer, or a delay-and-sum beamformer (DSB). We evaluate our algorithm on both speech enhancement and recognition tasks for the REVERB challenge dataset. Compared to the same processing done in the STFT domain, our approach achieves significant improvement in terms of objective enhancement metrics (including PESQ---the ITU-T standard measurement for speech quality). In terms of automatic speech recognition (ASR) performance as measured by word error rate (WER), our experiments indicate that the STFT with a long window is more effective for ASR.

研究の動機と目的

  • 混響およびノイズ環境下での音声強調と認識の課題を、信号の整合性を向上させることで解決すること。
  • 短いSTFT窓長によるスペクトル分解能の制限とノイズ抑圧に伴うアーチファクトを克服すること。
  • 分析窓長を延長しつつ、最適な単一チャネル推定器との互換性を維持することで、音声強調品質を向上させること。
  • 長時間窓を用いる場合の、客観的強調品質と自動音声認識(ASR)性能のトレードオフを調査すること。
  • REVERBチャレンジデータセットを用いて、STFChTとSTFTの両方の強調およびASRタスクにおける有効性を評価すること。

提案手法

  • 声の有声区間における線形な基本周波数(f0)変動をモデル化できる過完全な時周波数表現として、短時間ファンチルプ変換(STFChT)を用いることで、より長い整合性を持つ分析窓を実現する。
  • Habetsらが提唱したMMSE-LSA推定器をSTFChTドメインに適用し、音声および混響の統計的モデルに基づいてノイズと遅延混響を抑圧する。
  • 単一チャネル強調の前処理として、マルチチャネルデータにMVDRまたは遅延和束集束ビームフォーマーを適用し、信号対雑音比を向上させる。
  • STFChTでは分析窓長を128 msに延長し、標準的な32 ms STFT窓と比較して周波数分解能を高め、各周波数ビンの信号対雑音比を向上させる。
  • 窓長やf0トラッキング(例:i0.3による高調波追跡の向上)などのパラメータを最適化して性能を向上させる。
  • Kaldiベースのシステムを用い、fMLLR適応とMBRデコードを組み合わせたASRパイプラインに強調信号を統合し、評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1標準的なSTFT窓長を超えて分析窓長を延長することで、混響およびノイズ環境下での音声強調品質が向上するか?
  • RQ2STFChTドメインは、信号に長い整合性をもたらすが、STFTと比較してより優れた客観的強調指標(例:PESQ)を達成するか?
  • RQ3STFChTベースの強調は、優れた客観的品質スコアを示すにもかかわらず、自動音声認識(ASR)性能を向上させないのはなぜか?
  • RQ4長時間窓を用いる場合、客観的強調品質とASR語彙誤り率(WER)の間にトレードオフが生じるか?
  • RQ5STFChTを深層学習手法や他の整合性拡張変換と組み合わせることで、強調および認識性能をさらに向上できるか?

主な発見

  • STFChTベースの強調は、8チャネル入力のSimDataセットでPESQスコア2.10を達成し、128 msでのSTFT(1.94)を著しく上回り、より優れた客観的音声品質を示した。
  • RealDataセットでは、STFChTは128 msでPESQ 1.81、i0.3を用いた96 msでPESQ 1.81を達成し、128 msでのSTFT(1.66)を上回った。
  • 優れた強調品質にもかかわらず、STFChTはASR性能を向上させなかった。むしろ、長窓STFT(128 ms)は8チャネルMVDRビームフォーミングを用いたSimDataセットで最低のWER 7.31%を記録した。
  • SimDataセットにおけるSTFChT(128 ms窓)のWERは7.96%であったのに対し、長窓STFTは7.31%であったため、ASRではSTFTが依然として優れていることが示された。
  • STFChTはSRMRおよびFWSegSNR指標を向上させ、SimData(8ch)における中央値FWSegSNRは10.63を記録し、STFT(9.31)および元の信号を上回った。
  • 本研究では、STFChTは客観的品質を向上させるが、変換に起因する位相またはスペクトル歪みの可能性により、ASRには最適でないことが確認された。これにより、STFChTとSTFTを併用する可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。