[論文レビュー] VISinger: Variational Inference with Adversarial Learning for End-to-End Singing Voice Synthesis
VISingerは、変分推論と敵対的学習を用いたエンド・ツー・エンドの歌唱音声合成システムを提案する。VITSを改善し、フレーム単位の事前分布ネットワーク、F0予測器、ノート正規化済みのデュレーション予測器を導入することで、歌唱固有の音響的変動をモデル化した。中国語歌唱コーパスにおいて、2段階システムおよびオラクルVITSよりも優れたボーカル品質、自然さ、およびチューニング安定性を達成した。
In this paper, we propose VISinger, a complete end-to-end high-quality singing voice synthesis (SVS) system that directly generates audio waveform from lyrics and musical score. Our approach is inspired by VITS, which adopts VAE-based posterior encoder augmented with normalizing flow-based prior encoder and adversarial decoder to realize complete end-to-end speech generation. VISinger follows the main architecture of VITS, but makes substantial improvements to the prior encoder based on the characteristics of singing. First, instead of using phoneme-level mean and variance of acoustic features, we introduce a length regulator and a frame prior network to get the frame-level mean and variance on acoustic features, modeling the rich acoustic variation in singing. Second, we further introduce an F0 predictor to guide the frame prior network, leading to stabler singing performance. Finally, to improve the singing rhythm, we modify the duration predictor to specifically predict the phoneme to note duration ratio, helped with singing note normalization. Experiments on a professional Mandarin singing corpus show that VISinger significantly outperforms FastSpeech+Neural-Vocoder two-stage approach and the oracle VITS; ablation study demonstrates the effectiveness of different contributions.
研究の動機と目的
- 分離された音響モデルとニューラルボコーダを用いる2段階の歌唱音声合成システムにおけるトレーニング・インフェンスの不一致を解消すること。
- 元々発話用に設計されたVITSフレームワークを、高品質なエンド・ツー・エンドの歌唱音声合成システムに適応させること。
- バイブラートやチューニングなどの豊かな音響的変動を、特別なアーキテクチャ的変更によってモデル化すること。
- デュレーション予測器を発話からノートへのデュレーション比を予測する形に再定義することで、リズム的正確性とノート正規化を向上させること。
- 変分推論と敵対的学習によるエンド・ツー・エンドのトレーニングが、2段階ベースラインおよびオラクルVITSよりも優れた歌唱品質をもたらすことを実証すること。
提案手法
- VITSにインspiredされた条件付き変分オートエンコーダ(CVAE)フレームワークを採用し、事後分布エンコーダ、事前分布エンコーダ、敵対的デコーダを備える。
- VITSの発話単位の事前分布を、長さレギュレータを用いて音響特徴のフレーム単位の平均と分散をモデル化するフレーム単位の事前分布ネットワークに置き換える。
- フレーム事前分布ネットワークをガイドするF0予測器を導入し、チューニングの安定性を向上させ、ピッチエラーを低減する。
- デュレーション予測器を発話からノートへのデュレーション比を予測する形に変更し、より良い歌唱ノート正規化とリズム的正確性を実現する。
- 事前エンコーダにノーマライジングフローを、デコーダに敵対的学習を適用し、波形品質と分布の整合性を向上させる。
- 敵対的損失、VAE再構成損失、フローに基づく尤度最適化を用いて、全モデルをエンド・ツー・エンドでトレーニングする。

実験結果
リサーチクエスチョン
- RQ1VITSに基づくエンド・ツー・エンドフレームワークは、話声よりも豊かな音響的変動を有する高精細な歌唱音声合成に効果的に適応可能か?
- RQ2発話単位の分布ではなくフレーム単位の事前分布をモデル化することで、歌唱音声の品質と安定性が向上するか?
- RQ3F0ガイド付きのフレーム事前分布ネットワークは、どの程度チューニングエラーを低減させ、ボーカルの自然さを向上させるか?
- RQ4ノート正規化済みのデュレーション予測器は、リズム的正確性とデュレーションの一貫性を向上させるのにどの程度有効か?
- RQ5変分推論と敵対的学習によるエンド・ツー・エンドのトレーニングは、2段階システムおよびオラクルVITSを上回る歌唱合成品質をもたらすか?
主な発見
- VISingerは音質の平均意見スコア(MOS)が3.93、自然さのMOSが3.76を記録し、2段階のFastSpeech+WaveRNNベースラインを顕著に上回った。
- VISingerのF0平均絶対誤差(F0 MAE)は18.7 Hzであり、FastSpeech+WaveRNNの22.1 Hzより低く、ピッチの正確性が優れていることを示している。
- VISingerのデュレーション平均絶対誤差(Dur MAE)は12.3 msであり、2段階システムの15.6 msより低く、リズム的正確性の向上が確認された。
- アブレーションスタディにより、フレーム事前分布ネットワークを削除するとMOSが3.30(品質)および2.78(自然さ)に低下し、単にフローレイヤーを増やすのとは異なり、その必要性が裏付けられた。
- ノート正規化戦略により、デュレーションの分散が低減され、予測値が0に集中するようになり、デュレーションモデリングにおける有効性が確認された。
- VISingerはスペクトログラムにおいて明瞭な高周波数のハーモニクス成分を生成し、2段階システムよりも実測値に近い外観を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。