[論文レビュー] Robust One-Shot Singing Voice Conversion
本稿では、10秒未塔の参照音声を用いて、未学習の歌手に対しても高精細でピッチ正確な音声変換を実現する、新しいフレームワークであるRobust One-Shot Singing Voice Conversion (ROSVC) を提案する。入力がリバーブやアレンジ音楽によって歪められても、その影響を受けることなく動作する。GANベースのワンショットSVCモデルとピッチ分布マッチング、AdaINスキップ条件付けを組み合わせ、歪みに強い性能を発揮する二段階訓練戦略(Robustify)を採用し、音声品質とピッチ安定性を向上させる階層的拡散ベースの神経音声生成器(neural vocoder)を導入することで、主観的・客観的評価の両面で最先端手法を上回る性能を達成した。
Recent progress in deep generative models has improved the quality of voice conversion in the speech domain. However, high-quality singing voice conversion (SVC) of unseen singers remains challenging due to the wider variety of musical expressions in pitch, loudness, and pronunciation. Moreover, singing voices are often recorded with reverb and accompaniment music, which make SVC even more challenging. In this work, we present a robust one-shot SVC (ROSVC) that performs any-to-any SVC robustly even on such distorted singing voices. To this end, we first propose a one-shot SVC model based on generative adversarial networks that generalizes to unseen singers via partial domain conditioning and learns to accurately recover the target pitch via pitch distribution matching and AdaIN-skip conditioning. We then propose a two-stage training method called Robustify that train the one-shot SVC model in the first stage on clean data to ensure high-quality conversion, and introduces enhancement modules to the encoders of the model in the second stage to enhance the feature extraction from distorted singing voices. To further improve the voice quality and pitch reconstruction accuracy, we finally propose a hierarchical diffusion model for singing voice neural vocoders. Experimental results show that the proposed method outperforms state-of-the-art one-shot SVC baselines for both seen and unseen singers and significantly improves the robustness against distortions.
研究の動機と目的
- リバーブやバックグラウンド音楽などの現実的で歪んだ条件下において、未学習の歌手を対象とした高品質な歌唱音声変換(SVC)を実現すること。
- 事前処理(例:リバーブ除去や音源分離)に依存せずに、音声変換モデルの歪みに対する耐性を高めること。
- トレーニングデータに存在しないターゲット歌手に対しても、正確なピッチ回復と自然な音声品質を達成すること。
- 被変換音声の聴取的品質とピッチ安定性を向上させる神経音声生成器の開発
提案手法
- 生成的対抗ネットワーク(GANs)に基づくワンショットSVCモデルを提案し、部分的ドメイン条件付けとピッチ分布マッチングを組み合わせることで、未学習の歌手への一般化を実現する。
- ピッチ関連特徴を変換プロセス中に保持することで、ピッチ再構成精度を向上させるため、AdaINスキップ条件付けを導入する。
- 歪みに強い性能を発揮する二段階訓練フレームワーク「Robustify」を提案:まずクリアなデータで事前学習を行い高品質な変換を実現し、その後エンコーダーに強化モジュールを組み込んでリバーブや音楽干渉に強い性能を微調整する。
- 複数のサンプリングレートで動作する複数の拡散モデルを用いる階層的拡散モデルに基づく神経音声生成器(HPG)を設計し、高精細な歌唱音声を生成するとともに、ピッチ安定性を向上させる。
- 低周波成分の生成をガイドするために、低サンプリングレートの波形を直接条件付けとして使用するマルチスケール条件付け戦略を採用する。
- NUS48E、NHSS、MUSDB18の各データセットを用いて、5つの最先端ワンショットVCベースラインと比較して手法の有効性を検証した。
実験結果
リサーチクエスチョン
- RQ1ワンショットSVCモデルは、未学習の歌手に対して、正確なピッチと自然さを保ちつつ高品質な音声変換を達成できるか?
- RQ2リバーブや背景音楽といった現実世界の歪みに対して、事前処理に依存せずにワンショットSVCモデルの耐性を高めることは可能か?
- RQ3階層的拡散ベースの神経音声生成器は、自己回帰的またはGANベースの音声生成器と比較して、被変換歌唱音声の聴取的品質とピッチ正確性を向上させられるか?
- RQ4二段階訓練戦略(Robustify)は、歪んだ入力からの特徴抽出の耐性をどの程度向上させるか?
- RQ5低サンプリングレート波形への直接的条件付けは、生成音声の忠実度と安定性を向上させられるか?
主な発見
- 提案されたROSVCモデルはMOSスコア4.07を達成し、PriorGrad(3.70)やPWG(2.81)を大きく上回り、優れた聴取的品質を示した。
- 好みテストでは85.3%の評価者がHPG-2モデルをPriorGradより好んだことから、自然さと音質の優位性が確認された。
- 階層的拡散音声生成器(HPG-2)はPMAEが1.82と、PriorGrad(1.80)やPWG(3.12)を下回り、より優れたピッチ正確性を示した。
- 3段階の階層的モデルであるHPG-3は、PMAEを1.67まで低下させ、MCDを8.12まで改善し、計算コストは30%増加にとどまるものの、さらなる性能向上を示した。
- アブレーションスタディの結果、低周波成分の生成において低レート波形($x_0^2$)への条件付けが極めて重要であることが判明。メルスペクトログ램のみでは全周波数帯域の忠実度を確保できない。
- Robustify訓練戦略により、リバーブや音楽干渉に対する耐性が顕著に向上し、ベースラインが失敗する歪んだ入力に対しても安定した性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。