Skip to main content
QUICK REVIEW

[論文レビュー] Improving Perceptual Quality by Phone-Fortified Perceptual Loss using Wasserstein Distance for Speech Enhancement

Tsun-An Hsieh, Cheng Yu|arXiv (Cornell University)|Oct 28, 2020
Speech and Audio Processing参考文献 42被引用数 12
ひとこと要約

本稿では、wav2vecの潜在表現からの発音情報を取り入れ、分布の違いを Wasserstein 距離で測定する新しい損失関数である Phone-Fortified Perceptual Loss (PFPL) を提案する。PFPL は Voice Bank–DEMAND データセットで最先端の性能を達成し、PESQ や STOI といった知覚的品質および話者の理解度の指標において、既存の手法を上回った。

ABSTRACT

Speech enhancement (SE) aims to improve speech quality and intelligibility, which are both related to a smooth transition in speech segments that may carry linguistic information, e.g. phones and syllables. In this study, we propose a novel phone-fortified perceptual loss (PFPL) that takes phonetic information into account for training SE models. To effectively incorporate the phonetic information, the PFPL is computed based on latent representations of the wav2vec model, a powerful self-supervised encoder that renders rich phonetic information. To more accurately measure the distribution distances of the latent representations, the PFPL adopts the Wasserstein distance as the distance measure. Our experimental results first reveal that the PFPL is more correlated with the perceptual evaluation metrics, as compared to signal-level losses. Moreover, the results showed that the PFPL can enable a deep complex U-Net SE model to achieve highly competitive performance in terms of standardized quality and intelligibility evaluations on the Voice Bank-DEMAND dataset.

研究の動機と目的

  • 音声の質と理解度が、音素や音節といった発音単位の滑らかな遷移に依存することを踏まえ、損失関数に発音情報を統合することで音声強化を改善すること。
  • 信号レベルの損失(例:L1、L2)が人間の知覚評価指標と相関が低いという限界を是正すること。
  • wav2vec からの自己教師あり表現を活用することで、より豊かな発音的コンテンツを有する表現の忠実度を向上させること。
  • 幾何的に意味のある距離計測法を用いて、ノイズありとクリアな音声の潜在空間における分布の整合性を向上させること。
  • 人間の聴覚認識をより正確に反映する知覚損失を導入することで、音声強化におけるより優れた一般化性能と知覚的品質を達成すること。

提案手法

  • PFPL は、豊かな発音的および言語的情報を捉えることができる事前学習済み wav2vec モデルの潜在表現に基づいて知覚的損失を計算する。
  • 損失は、強化音声とクリア音声の潜在特徴間の分布差を測定するために Wasserstein 距離(W1)を用い、最適輸送に基づく整合性を実現する。
  • 全体の目的関数は、信号の忠実度を保ちながら知覚的品質を向上させるために、PFPL と標準的な再構成損失(MAE)を組み合わせる。
  • 本手法は、音声強化を最適輸送問題として扱い、wav2vec 埋め込み空間におけるノイズありとクリアな音声表現間の Wasserstein 距離を最小化する。
  • 深く複素数の U-Net アーキテクチャを用いて、PFPL を主な知覚的目的関数として、エンドツーエンドでモデルを訓練する。
  • アブレーションスタディにより、各構成要素(発音表現、Wasserstein 距離、再構成損失)の寄与度が検証された。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり表現からの発音情報を損失関数に統合することで、知覚的品質における音声強化性能が向上するか?
  • RQ2標準的な Lp 範囲とは対照的に、Wasserstein 距離を知覚的損失の測定に用いることで、ノイズありとクリアな音声表現の間の整合性が向上するか?
  • RQ3人間の評価指標との相関度において、PFPL は信号レベルの損失や既存の知覚損失(例:DFL、PERL)と比較して優れているか?
  • RQ4PFPL の各構成要素(発音表現、Wasserstein 距離、再構成損失)が最終的な性能に果たす寄与度は何か?
  • RQ5PFPL で訓練されたモデルは、標準化された音声強化ベンチマークで最先端の結果を達成できるか?

主な発見

  • PFPL は Voice Bank–DEMAND データセットにおいて、比較手法すべてより高い PESQ スコア(3.15)を達成し、DFL(2.58)、MetricGAN(2.86)、HiFi-GAN(2.94)を上回った。
  • PFPL 損失は知覚指標と最も強い相関を示した:PESQ とのピアソン積率相関係数(PCC)は 0.89、STOI との PCC は 0.87 であり、L1、L2、wSDR、DFL より顕著に高い値であった。
  • アブレーションスタディにより、Wasserstein 距離の使用(PFPL 対 PFPL - W)が性能向上に寄与することが確認され、PESQ は 3.11 から 3.15 に、STOI は 0.95 から 0.95 に上昇した。
  • MAE 損失の導入(PFPL - W 対 PFPL - W - MAE)により、CBAK は 3.05 から 3.52 に向上し、背景音声の品質がより良く保たれた。
  • PFPL は CSIG スコア 4.18 と COVL 3.67 を達成し、高い音声品質と自然さを示し、PERL-wav2vec(CSIG:4.16、COVL:3.54)を上回った。
  • 結果から、PFPL は人間の聴覚認識を反映する形で、強化音声とクリア音声の潜在表現を、特に発音の連続性と理解度の観点から効果的に整合させていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。