Skip to main content
QUICK REVIEW

[論文レビュー] Speech Synthesis and Control Using Differentiable DSP

Giorgio Fabbro, Vladimir Golkov|arXiv (Cornell University)|Oct 28, 2020
Music and Audio Processing参考文献 28被引用数 6
ひとこと要約

この論文は、推論時に制御を必要とせずに、周波数、リズム、音量、トーンといった音声の変動要因を明示的かつ分離可能に制御できる、微分可能デジタル信号処理(DDSP)に基づくニューラルボコーダーを提案する。学習可能な制御変数を微分可能DSPフレームワークに統合することで、高品質で自然な音声を合成可能であり、長時間の音声処理において速度とモデルサイズの面で既存のボコーダーを上回る。

ABSTRACT

Modern text-to-speech systems are able to produce natural and high-quality speech, but speech contains factors of variation (e.g. pitch, rhythm, loudness, timbre)\ that text alone cannot contain. In this work we move towards a speech synthesis system that can produce diverse speech renditions of a text by allowing (but not requiring) explicit control over the various factors of variation. We propose a new neural vocoder that offers control of such factors of variation. This is achieved by employing differentiable digital signal processing (DDSP) (previously used only for music rather than speech), which exposes these factors of variation. The results show that the proposed approach can produce natural speech with realistic timbre, and individual factors of variation can be freely controlled.

研究の動機と目的

  • 周波数、リズム、音量、トーンといった変動要因の明示的制御を可能にしつつ、推論時にそれらを必要としない音声合成システムの開発。
  • 従来音楽分野でのみ利用されていた微分可能DSP(DDSP)を音声合成に拡張し、解釈可能で制御可能な音声生成を実現。
  • アーキテクチャの再設計を必要とせず、任意のスペクトログラム生成器と互換性を持つように、ニューラルボコーダー内に直接制御を統合。
  • エッジデプロイメントに適した性能を維持しつつ、高速な合成速度と小さなモデルサイズを実現。
  • 将来的な音声の変動やスタイル編集の応用を見据え、ボコーダーステージで音声要因を分離可能にすることの可能性を検討。

提案手法

  • 再帰的ニューラルネットワークを用いてメルスペクトログラムを、解釈可能な制御変数(アタック・エンvelope、高調波分布、フィルタ係数)に分解する。
  • これらの制御変数が微分可能DSPジェネレータ(母音にはオシレータ、子音にはノイズジェネレータ)を駆動し、制御可能なパrameterで直接音声波形を合成可能となる。
  • 学習段階では、ネットワークが他の変動要因をモデル化できるかを隔離するため、推論で学習したものを用いるのではなく、真値の周波数コントゥアを用いる。
  • 固定で微分可能なDSP演算をニューラルネットワーク内に統合することで、エンド・ツー・エンド最適化を可能にしつつ、制御変数の解釈可能性を維持。
  • テキストから音声へのパイプラインだけでなく、生成後の制御変数の変更により、既存の音声クリップの直接的編集も可能。
  • 制御変数をDSPジェネレータに供給することで波形を生成するため、エンド・ツー・エンドの損失関数に基づいて学習し、推論を実行。

実験結果

リサーチクエスチョン

  • RQ1微分可能DSPは、周波数、リズム、音量、トーンといった変動要因の分離可能な制御を可能にするために音声合成に効果的に適用可能か?
  • RQ2DDSPベースのニューラルボコーダーは、高速な推論速度と小さなモデルサイズを維持しつつ、高い知覚的品質を達成できるか?
  • RQ3制御をTTSパイプラインの初期段階ではなくボコーダーステージで行うことで、より広範な互換性と後処理による編集が可能になるか?
  • RQ4WaveGlow や WaveNet といった最先端のニューラルボコーダーと比較して、このモデルの速度、サイズ、音声品質の面での性能はどの程度か?
  • RQ5このモデルの制御変数を用いて、同じ発話の自然な音声バリエーションをどの程度生成できるか?

主な発見

  • 提案されたDDSPベースのニューラルボコーダーは、2秒以上の長さの音声クリップに対して、ほぼ40倍のリアルタイム速度を達成し、長時間のシーケンスにおいてWaveGlowを上回る速度性能を示した。
  • 単一GPUで2.5日間で収束したが、WaveNet(4–5日間)やWaveGlow(10日以上)と比較して、著しく高速な学習を実現した。
  • パラメータ数が490万個と少なく、WaveGlow(8780万個)を下回り、WaveNetと同等のサイズであり、エッジデプロイメントに適している。
  • 中央値MUSHRAスコアが100点中40点を記録し、中程度の知覚的品質を示したが、主な制限要因は良好なトーンモデリングにもかかわらず、不自然な子音音声の生成であった。
  • Griffin–Liman法は同程度のMUSHRAスコアを達成したが、その理由は異なっていた—提案モデルでは人工的な子音が生じたのに対し、Griffin–Limanでは位相推定誤差が原因であった—これにより、1次元の品質指標の限界が浮き彫りになった。
  • モデルはボコーダーステージで周波数その他の変動要因の直接制御が可能であり、再トレーニングやスペクトログラム生成器の変更なしに、生成後の音声編集が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。