Skip to main content
QUICK REVIEW

[論文レビュー] Differentiable WORLD Synthesizer-based Neural Vocoder With Application To End-To-End Audio Style Transfer

Shahan Nercessian|arXiv (Cornell University)|Aug 15, 2022
Speech and Audio Processing被引用数 6
ひとこと要約

本稿では、学習可能なパラメータを一切持たない高精細で周波数を保持する神経音声生成を可能にする、エンドツーエンド音声スタイル転送向けの微分可能WORLD合成器を提案する。微分可能信号処理とオプションの軽量ポストネットを活用することで、再構成品質がSOTAを達成し、特に音声変換およびトーン転送タスクで安定した学習が可能となる。

ABSTRACT

In this paper, we propose a differentiable WORLD synthesizer and demonstrate its use in end-to-end audio style transfer tasks such as (singing) voice conversion and the DDSP timbre transfer task. Accordingly, our baseline differentiable synthesizer has no model parameters, yet it yields adequate synthesis quality. We can extend the baseline synthesizer by appending lightweight black-box postnets which apply further processing to the baseline output in order to improve fidelity. An alternative differentiable approach considers extraction of the source excitation spectrum directly, which can improve naturalness albeit for a narrower class of style transfer applications. The acoustic feature parameterization used by our approaches has the added benefit that it naturally disentangles pitch and timbral information so that they can be modeled separately. Moreover, as there exists a robust means of estimating these acoustic features from monophonic audio sources, it allows for parameter loss terms to be added to an end-to-end objective function, which can help convergence and/or further stabilize (adversarial) training.

研究の動機と目的

  • 音声合成における位相整合性と周波数フォルムの維持を図る、WORLD音声生成器の微分可能版の開発。
  • 学習目的関数に微分可能信号処理を統合することで、音声スタイル転送システムのエンドツーエンド学習を可能にすること。
  • 自然さの向上を目的とした、直接的励振スペクトル操作を含む代替微分可能アーキテクチャの検討。
  • 非パrametricな微分可能合成器が、周波数とトーンの分離モデリングを可能にし、競争力ある合成品質を達成できることの実証。
  • 真値音声特徴パrameter化を監視信号として組み込むことで、神経音声生成器における敵対的学習の安定化。

提案手法

  • ベースラインの微分可能WORLD合成器は、元のWORLDアルゴリズムの微分可能実装を用いて、基本周波数(f0)、スペクトルエンVELOP(sp)、非周期性(ap)から音声波形を再構成する。
  • 合成出力に軽量で非自己回帰型のポストネットを追加し、スペクトルの忠実度を向上させ、アーチファクトを低減する。
  • 代替手法として、励振スペクトルを直接操作し、元の信号の高調波成分を維持しながら新たなスペクトルエンVELOPを適用する。
  • 音声特徴表現は自然に周波数(f0)とトーン(sp, ap)を分離するため、パラメータ損失項による別々のモデリングと監視が可能になる。
  • logメルスペクトログ램に対するL1損失と、必要に応じてディスクライマと特徴損失を用いた敵対的学習を組み合わせたエンドツーエンド学習を実施。
  • 真値WORLDパラメータを特徴損失の監視ターゲットとして用いることで、敵対的学習の収束性と安定性が向上する。

実験結果

リサーチクエスチョン

  • RQ1学習可能なパラメータを一切持たない微分可能WORLD合成器は、高精細な音声再構成を達成できるか?
  • RQ2微分可能WORLD合成は、エンドツーエンド音声スタイル転送システムにおける学習安定性と収束性をどのように向上させるか?
  • RQ3ポストネットモジュールは、非自己回帰型で微分可能な音声生成フレームワークにおいて、合成品質をどの程度向上させるか?
  • RQ4励振スペクトルの直接的操作は、全波形合成と比較して、トーン転送タスクにおける自然さを向上させるか?
  • RQ5音声特徴パラメータ(f0, sp, ap)は、エンドツーエンド学習において効果的な監視信号として機能するか?

主な発見

  • 微分可能WORLD合成器は、歌唱音声変換(SVC)タスクでメルスペクトログラム再構成誤差0.2050を達成し、強力な非パrametricベースラインを提供する。
  • ポストネットと敵対的学習を組み合わせたバージョン(E2E+DiffWORLDSynth+Postnet+GAN)は、わずかに高い再構成誤差(0.2215)を示したが、知覚的品質とより詳細なスペクトル構造が向上した。
  • オラクル監視付きバージョン(E2E+DiffWORLDSynth+Oracle)は、WORLDで合成されたターゲットと比較して、顕著に低い誤差(0.1014)を達成し、真値音声特徴の監視による利点を示した。
  • 励振ベースの手法(E2E+DiffWORLDExcite)は、最小の再構成誤差(0.0421)を達成し、励振スペクトルの正確な推定が可能な場合に優れた性能を示した。
  • 微分可能合成器により、DDSPトーン転送タスクのエンドツーエンド学習が有効に可能となり、再構成誤差0.2465を達成した。これは、音声変換を超えた汎用性を示している。
  • 敵対的学習により、フォルマント帯域をタイトに保ち、チクチク感を低減し、知覚的品質が向上した。これは、L1誤差がわずかに増加しても同様に成立する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。