Skip to main content
QUICK REVIEW

[論文レビュー] IQDUBBING: Prosody modeling based on discrete self-supervised speech representation for expressive voice conversion

Wendong Gan, Bolong Wen|arXiv (Cornell University)|Jan 2, 2022
Speech Recognition and Synthesis被引用数 7
ひとこと要約

本論文では、VQ-Wav2Vecから得られる離散的自己教師付き音声表現(DSSR)を活用して、話者、内容、環境要因から分離された抑揚をモデル化する、新しい表現力のある音声変換フレームワークであるIQDubbingを提案する。2種類の抑揚フィルタ(ランダムダウンサンプリングフィルタとアラインドダウンサンプリングフィルタ)を適用することで、抑揚を効果的に分離し、最先端の音声品質(MOS 3.867)、高い抑揚の一貫性、強力な話者類似度を達成した。

ABSTRACT

Prosody modeling is important, but still challenging in expressive voice conversion. As prosody is difficult to model, and other factors, e.g., speaker, environment and content, which are entangled with prosody in speech, should be removed in prosody modeling. In this paper, we present IQDubbing to solve this problem for expressive voice conversion. To model prosody, we leverage the recent advances in discrete self-supervised speech representation (DSSR). Specifically, prosody vector is first extracted from pre-trained VQ-Wav2Vec model, where rich prosody information is embedded while most speaker and environment information are removed effectively by quantization. To further filter out the redundant information except prosody, such as content and partial speaker information, we propose two kinds of prosody filters to sample prosody from the prosody vector. Experiments show that IQDubbing is superior to baseline and comparison systems in terms of speech quality while maintaining prosody consistency and speaker similarity.

研究の動機と目的

  • 話者、内容、環境要因と混ざり合った抑揚を表現力のある音声変換でモデル化する課題に対処すること。
  • 非並列な表現力のある音声において、話者および内容情報から抑揚を分離できない既存手法の限界を克服すること。
  • 離散的自己教師付き表現(DSSR)と専用の抑揚フィルタリング機構を活用することで、音声変換における音声品質と抑揚の一貫性を向上させること。
  • 非並列な設定において、源話者の表現力のある抑揚をターゲット話者に移転する際、高い話者類似度を維持すること。
  • 2つの新規抑揚フィルタ(RDPFとADPF)が、より良い分離と性能を実現するための抑揚ベクトルの精錬に有効であることを示すこと。

提案手法

  • 話者と環境要因の情報をベクトル量子化によって内蔵的に抑制するVQ-Wav2Vecの事前学習モデルを用い、源音声から離散的自己教師付き音声表現(DSSR)を抽出する。
  • 抑揚エンコーダーを用いてDSSRから抑揚ベクトルを抽出し、話者および内容の漏れを最小限に抑えた豊かな抑揚コンテンツを捉える。
  • ランダムダウンサンプリング抑揚フィルタ(RDPF)とアラインドダウンサンプリング抑揚フィルタ(ADPF)の2種類の抑揚フィルタを適用し、関連する抑揚特徴のみをサンプリングすることで、抑揚ベクトルをさらに精錬する。
  • ASRボトルネック特徴から言語的コンテンツを抽出するコンテンツエンコーダー、話者アイデンティティを抽出する話者エンコーダー、および変換型自己回帰的デコーダー(Transformerベース)を用いてメルスペクトログ램を再構築する。
  • Adam最適化アルゴリズムを用い、学習率の減少を適用し、波形合成にはParallel WaveGANを用いてシステム全体を訓練する。
  • コンテンツ、抑揚、話者ベクトルをデコーダーの入力として組み合わせ、エンドツーエンドでシステムを最適化する。

実験結果

リサーチクエスチョン

  • RQ1VQ-Wav2Vecからの離散的自己教師付き音声表現(DSSR)は、表現力のある音声変換において、話者および環境要因の情報を効果的に抑制しながら抑揚をモデル化できるか?
  • RQ2提案された抑揚フィルタ(RDPFとADPF)は、抑揚ベクトル内のコンテンツおよび残存話者情報からさらに抑揚を分離するのにどの程度有効か?
  • RQ3IQDubbingフレームワークは、ベースラインおよび最先端手法と比較して、表現力のある音声変換において優れた音声品質を達成できるか?
  • RQ4IQDubbingは音声変換中に抑揚の一貫性と話者類似度をどの程度維持できるか?
  • RQ5音声品質と抑揚の忠実度を向上させる観点で、アラインドダウンサンプリング抑揚フィルタ(ADPF)はランダムダウンサンプリング抑揚フィルタ(RDPF)よりも効果的か?

主な発見

  • IQDubbing-ADPFは最高の平均意見スコア(MOS)3.867を達成し、ベースライン(3.733)および比較システム(3.267)を顕著に上回り、優れた音声品質を示した。
  • 抑揚の一貫性に関するABテストでは、IQDubbing-ADPFがすべてのベースライン(IQDubbing-BaseおよびIQDubbing-RDPFを含む)を上回り、元の抑揚を効果的に維持していることを確認した。
  • 話者類似度の誤受容率(FAR)はIQDubbing-ADPFで0.830と、ベースライン(0.833)に近く、抑揚移転の際も強力な話者類似度を維持していることを示した。
  • IQDubbing-Baseは比較システム(0.617)よりも高いFAR(0.818)を示し、DSSRに基づく抑揚モデル化が従来手法よりも話者類似度を向上させることを示した。
  • RDPFベースのバージョン(IQDubbing-RDPF)はMOSが3.417と、IQDubbing-Base(3.750)よりも低く、ランダムダウンサンプリングの不安定さとADPFの構造的サンプリングの優位性を示した。
  • ADPFフィルタはRDPFよりも、抑揚ベクトルからコンテンツおよび話者関連情報を取り除くのに効果的であり、より優れた音声品質と抑揚の一貫性をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。