Skip to main content
QUICK REVIEW

[論文レビュー] Discretization and Re-synthesis: an alternative method to solve the Cocktail Party Problem

Jing Shi, Xuankai Chang|arXiv (Cornell University)|Dec 17, 2021
Speech and Audio Processing被引用数 11
ひとこと要約

本論文は、従来の回帰ベースの手法に代わる分類駆動型フレームワークを用いた新しい音声分離手法を提案する。離散的記号列を用いた手法により、VQ-VAE や HuBERT を用いて離散化し、HiFi-GAN を用いて再合成することで、高品質で干渉が少ない音声分離を実現するとともに、スムーズなスピーカー変換を可能にし、主観的品質と干渉低減の面で回帰ベースのモデルを上回る性能を発揮する。

ABSTRACT

Deep learning based models have significantly improved the performance of speech separation with input mixtures like the cocktail party. Prominent methods (e.g., frequency-domain and time-domain speech separation) usually build regression models to predict the ground-truth speech from the mixture, using the masking-based design and the signal-level loss criterion (e.g., MSE or SI-SNR). This study demonstrates, for the first time, that the synthesis-based approach can also perform well on this problem, with great flexibility and strong potential. Specifically, we propose a novel speech separation/enhancement model based on the recognition of discrete symbols, and convert the paradigm of the speech separation/enhancement related tasks from regression to classification. By utilizing the synthesis model with the input of discrete symbols, after the prediction of discrete symbol sequence, each target speech could be re-synthesized. Evaluation results based on the WSJ0-2mix and VCTK-noisy corpora in various settings show that our proposed method can steadily synthesize the separated speech with high speech quality and without any interference, which is difficult to avoid in regression-based methods. In addition, with negligible loss of listening quality, the speaker conversion of enhanced/separated speech could be easily realized through our method.

研究の動機と目的

  • 類似するスピーカーや非定常雑音の状況において、回帰ベースの音声分離モデルの限界を解消すること。
  • 連続的な波形の回帰から離散的記号を用いた系列分類へのパラダイム転換を検討することで、音声分離の代替手法を提案すること。
  • 予測された離散的表現からの再合成により、カクテルパーティー問題の状況下で音声品質を向上させ、干渉を低減すること。
  • 最小限の品質劣化で、分離された音声における柔軟なスピーカー変換を可能にすること。

提案手法

  • VQ-VAE や HuBERT を用いて、ターゲット音声を離散的記号の系列に変換する。
  • 分類ベースのモデルが混合入力から各スピーカーの離散的記号系列を予測する。
  • 予測された離散的系列を HiFi-GAN ボコーダーを用いて波形に再合成する。
  • 異なるスピーカー埋め込みを用いて離散的記号系列を転送することで、スピーカー変換をサポートする。
  • 2段階の処理で動作する:離散的記号の予測と波形再合成。
  • 連続的な波形への直接回帰を避けることで、マスクベース手法で一般的に見られる干渉アーチファクトを低減する。

実験結果

リサーチクエスチョン

  • RQ1離散的記号を用いた分類ベースの手法が、回帰ベースのモデルに比べて音声分離の品質と干渉低減において優れているかどうか。
  • RQ2本手法は、類似するスピーカーと非定常雑音の状況下でも、どのように性能を発揮するか。
  • RQ3離散的再合成フレームワーク内で、音声品質の劣化を最小限に抑えながら、どの程度のスピーカー変換が可能か。
  • RQ4なぜ、客観的評価(例:PESQ、SI-SNR)は、再合成出力の高い主観的品質を反映していないのか。

主な発見

  • 本手法は、VCTK-noisy コーパスにおいて、主観的平均評価点(sMOS)4.02 ± 0.14 を達成し、クリアな正解(4.03 ± 0.13)にほぼ同等の高音質を示した。
  • ベースラインと比較して、重複音声比をほぼ1桁低減し、著しくクリアな分離を実現した。
  • WSJ0-2mix コーパスでは、性別ペアの組み合わせに関わらず一貫した性能を示し、同性ペアにおいても品質の著しい低下がなく、ベースラインモデルとは対照的であった。
  • 微調整後、合成音声の音声認識誤り率(WER)は22.4%から13.0%に改善され、元のノイズ混在入力(19.5%)を上回り、優れた音声の明瞭さを示した。
  • VCTK-noisy コーパスでは、ノイズの主観的評価点(MOS)が4.02とほぼ完璧に近く、クリアな参照値に近づき、知覚的劣化が最小限であることを示した。
  • PESQ が1.26と低いにもかかわらず、優れた主観的品質を提供したため、客観的指標と人間の知覚の間に乖離が生じていることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。