Skip to main content
QUICK REVIEW

[論文レビュー] Speech denoising by parametric resynthesis

Soumi Maiti, Michael Mandel|arXiv (Cornell University)|Apr 2, 2019
Speech and Audio Processing参考文献 18被引用数 4
ひとこと要約

本稿では、ノイズが混入した入力からニューラルネットワークを用いて綺麗な音声の音声合成パラメータを予測し、音声合成器を介して高品質でノイズのない音声を再合成する、パrametricな再合成手法を提案する。この手法は、オラクル・ウィーナー・マスクと同等の主観的品質と弁別性を達成し、DNNベースのマスク予測を上回る。ノイズが混入した音声に内在するプロソディが、テキストベースの合成と比較して優れた音声品質を実現できることを示している。

ABSTRACT

This work proposes the use of clean speech vocoder parameters as the target for a neural network performing speech enhancement. These parameters have been designed for text-to-speech synthesis so that they both produce high-quality resyntheses and also are straightforward to model with neural networks, but have not been utilized in speech enhancement until now. In comparison to a matched text-to-speech system that is given the ground truth transcripts of the noisy speech, our model is able to produce more natural speech because it has access to the true prosody in the noisy speech. In comparison to two denoising systems, the oracle Wiener mask and a DNN-based mask predictor, our model equals the oracle Wiener mask in subjective quality and intelligibility and surpasses the realistic system. A vocoder-based upper bound shows that there is still room for improvement with this approach beyond the oracle Wiener mask. We test speaker-dependence with two speakers and show that a single model can be used for multiple speakers.

研究の動機と目的

  • ノイズが混入した音声に内在するプロソディ情報を活用することで、テキストベースのTTSシステムで失われる情報を補完し、音声ノイズ除去の性能を向上させること。
  • 従来の音声強調技術の限界、すなわち音声の過剰抑制とノイズの不十分な抑制を是正すること。
  • 高品質な音声合成に設計された綺麗な音声の音声合成パラメータが、ニューラルネットワークベースのノイズ除去の目的関数として有効であるかを検証すること。
  • 提案手法の性能を、オラクル・ウィーナー・マスクやDNNベースのマスク予測といった既存のベースラインと比較して評価すること。
  • 単一のトレーニング済みシステムで複数の話者の間で一般化できるか、話者に依存しない性能を検証すること。

提案手法

  • ノイズ混入音声のログメルスペクトログラム特徴量から、綺麗な音声の音声アコースティックパラメータ(スペクトルエンベロープ、F0、音声/非音声、アペリオディックエネルギー)を予測するニューラルネットワークを訓練する。
  • WORLD音声合成器を用いて綺麗な音声をアコースティックパラメータに符号化し、予測されたパラメータを再び波形に復元することで、高精細な再合成を実現する。
  • 予測値と正解値のアコースティック特徴量間の平均二乗誤差損失関数を用いてモデルを訓練し、一次および二次の微分特徴量も含める。
  • 時間的文脈をモデル化するため、フィードフォワードDNNとLSTMアーキテクチャを併用し、LSTMバージョンがより優れた性能を示した。
  • ノイズ混入音声にモデルを適用し、綺麗なパラメータを予測して信号を再合成することで、ノイズのない出力を得る。
  • 音声合成器に基づく上限性能(upper bound)を用いて、この手法の潜在的な限界を評価し、オラクル・ウィーナー・マスクを上回る改善の余地があることを示した。

実験結果

リサーチクエスチョン

  • RQ1綺麗な音声の音声合成パラメータは、ニューラルネットワークベースの音声ノイズ除去の有効な目的関数として適しているか?
  • RQ2ノイズ混入音声に内在するプロソディを利用することで、テキストベースのTTSシステムと比較して音声品質が向上するか?
  • RQ3主観的品質と弁別性という観点から、パラメトリック再合成の性能は、オラクル・ウィーナー・マスクおよびDNNベースのマスク予測と比較してどうなるか?
  • RQ4話者固有の適応なしに、単一のモデルが複数の話者に一般化して性能を発揮できるか?
  • RQ5このパラメトリック再合成手法の性能上限は何か? また、既存手法と比較してどうなるか?

主な発見

  • パラメトリック再合成モデルは、綺麗な信号にアクセス可能なオラクル・ウィーナー・マスクと同等の主観的音声品質と弁別性を達成した。
  • 主観的品質と弁別性の両面で、DNNベースのマスク予測器を上回った。PESQスコアは2.43(対象:2.26)、STOIは0.87(対象:0.80)であった。
  • MUSHRAによる主観的テストで、ノイズ除去品質がオラクル・ウィーナー・マスクを上回り、ノイズのない音声が得られていることが確認された。
  • 標準的な統計的TTSシステムと比較して、客観的指標および主観的品質の両面で優れた性能を示した。PESQは2.43(対象:1.33)、STOIは0.87(対象:0.08)であった。
  • 複数話者のデータでトレーニングした単一のモデルが、話者に依存せずに高い性能を発揮し、話者独立性が有効に実現された。
  • 音声合成器に基づく上限性能の評価から、オラクル・ウィーナー・マスクを上回る改善の余地があることが示され、さらなる最適化の可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。