Skip to main content
QUICK REVIEW

[論文レビュー] Noisy-to-Noisy Voice Conversion Framework with Denoising Model

Chao Xie, Yi-Chiao Wu|arXiv (Cornell University)|Sep 22, 2021
Speech Recognition and Synthesis参考文献 6被引用数 7
ひとこと要約

本稿では、事前学習済みのノイズ除去モデル(DCCRN)をVQ-VAEベースのVCモデルと統合することで、話者変換中に背景音を保持するノイズ多きい入力からノイズ多きい出力への音声変換(N2N VC)フレームワークを提案する。この手法は、入力の音声とノイズを分離し、綺麗な音声に対してVCを適用した後、出力に元の背景ノイズを再挿入することで、自然さと話者類似度が向上し、文脈的な音声忠実度を維持した優れた性能を達成している。直接のノイズ多きい入力からの学習に比べて優れている。

ABSTRACT

In a conventional voice conversion (VC) framework, a VC model is often trained with a clean dataset consisting of speech data carefully recorded and selected by minimizing background interference. However, collecting such a high-quality dataset is expensive and time-consuming. Leveraging crowd-sourced speech data in training is more economical. Moreover, for some real-world VC scenarios such as VC in video and VC-based data augmentation for speech recognition systems, the background sounds themselves are also informative and need to be maintained. In this paper, to explore VC with the flexibility of handling background sounds, we propose a noisy-to-noisy (N2N) VC framework composed of a denoising module and a VC module. With the proposed framework, we can convert the speaker's identity while preserving the background sounds. Both objective and subjective evaluations are conducted, and the results reveal the effectiveness of the proposed framework.

研究の動機と目的

  • 高価なクリアなデータセットに依存する従来のVCの限界を是正するため、低品質でノイズの多い音声データからの学習を可能にする。
  • 実世界の応用(動画処理やASRのデータ拡張など)に適した、変換中に背景音を維持する柔軟なVCフレームワークを開発する。
  • 学習データに背景ノイズが含まれる場合、事前学習済みのノイズ除去モデルがVC性能を向上させるかを調査する。
  • 異なるノイズ除去モデル(DCCRN 対 Conv-TasNet)が、下流のVC品質と耐障害性に与える影響を比較する。
  • さまざまな信号対雑音比(SNR)の下で、客観的指標と主観的聴取テストを用いて、提案フレームワークを評価する。

提案手法

  • 2段階のフレームワークを採用:まず、事前学習済みのDCCRNノイズ除去モデルが、ノイズ多きい入力を推定された音声と背景ノイズ成分に分離する。
  • そのノイズ除去済み音声を用いて、VQ-VAEベースの音声変換モデルを学習させ、話者アイデンティティを移す一方で言語的コンテンツを保持する。
  • 推論段階では、同じノイズ除去モデルが入力発話処理を行い、綺麗な音声と背景ノイズ信号を独立して抽出する。
  • 変換済み音声は、元の背景ノイズと再結合され、入力の音響環境を保持した最終出力を得る。
  • フレームワークは柔軟な制御を可能にし、アプリケーションのニーズに応じて背景ノイズを再挿入または抑制できる。
  • DCCRNとConv-TasNetをノイズ除去部品として用い、それらがVC性能に与える影響を比較評価する。

実験結果

リサーチクエスチョン

  • RQ1ノイズ多きい音声データのみで学習した音声変換システムが、背景音を保持しつつ高品質な出力を達成できるか?
  • RQ2事前学習済みノイズ除去モデル(例:DCCRN)を統合することで、ノイズ多きいデータからの直接学習に比べ、ノイズ多きい入力からノイズ多きい出力へのVC性能がどのように向上するか?
  • RQ3異なるノイズ除去アーキテクチャ(DCCRN 対 Conv-TasNet)が、変換音声の自然さと話者類似度に与える影響は何か?
  • RQ4ノイズ除去モデルが引き起こすアーティファクトが、VCパイプライン全体の最終出力音声品質にどの程度悪影響を及ぼすか?
  • RQ5提案フレームワークは、クリアな入力からクリアな出力へのVCに近い性能を達成しつつ、文脈的な背景音を維持できるか?

主な発見

  • DCCRN-VCフレームワークは、平均意見スコア(MOS)3.08および話者類似度(SIM)スコア51.6を達成し、ベースラインのNoisy-VC(MOS: 2.07、SIM: 39.4)を顕著に上回った。
  • DCCRN-VCの性能は、さまざまなSNRレベル(7 dBおよび15 dB)で安定しており、ノイズの変動に強いことが示された。
  • ConvTas-VCはDCCRN-VCと同等のMOSスコア(3.08)を達成したため、Conv-TasNetからの残存ノイズが再結合時に最小限の知覚的影響しか与えないことが示された。
  • DCCRNは優れたノイズ除去性能を示したが、その導入するアーティファクトがわずかに音声品質を低下させ、MOS向上がConvTas-VCに比べて限定的であった。
  • 提案フレームワークは、直接のノイズ多きい入力からの学習に比べて明確な優位性を示し、ノイズ多きい入力からノイズ多きい出力へのVCで準最先端の性能を達成した。これは、VCパイプラインにおける事前ノイズ除去の価値を裏付けた。
  • 主観的評価により、再結合された背景音が適切に保持され、知覚的に自然であることが確認された。これは、本フレームワークが実世界応用に適していることを支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。