[論文レビュー] Learning Singing From Speech
本論文では、唯一の通常の音声データから転送可能なスピーカー埋め込みを学習する統合的音声・歌唱合成フレームワークを提案する。これにより、ターゲットスピーカーの歌唱データが一切不要な状態で、高品質な歌唱音声変換が可能になる。DurIAN-4Sを用いて音声と歌唱データを同時に学習することで、共有されるスピーカー埋め込みと追加の音響特徴(f0およびRMSE)を活用し、ターゲットスピーカーのトーンに非常に近い自然な響きの歌唱を合成する。
We propose an algorithm that is capable of synthesizing high quality target speaker's singing voice given only their normal speech samples. The proposed algorithm first integrate speech and singing synthesis into a unified framework, and learns universal speaker embeddings that are shareable between speech and singing synthesis tasks. Specifically, the speaker embeddings learned from normal speech via the speech synthesis objective are shared with those learned from singing samples via the singing synthesis objective in the unified training framework. This makes the learned speaker embedding a transferable representation for both speaking and singing. We evaluate the proposed algorithm on singing voice conversion task where the content of original singing is covered with the timbre of another speaker's voice learned purely from their normal speech samples. Our experiments indicate that the proposed algorithm generates high-quality singing voices that sound highly similar to target speaker's voice given only his or her normal speech samples. We believe that proposed algorithm will open up new opportunities for singing synthesis and conversion for broader users and applications.
研究の動機と目的
- ターゲットスピーカーの通常の音声サンプルのみを用いて、高品質な歌唱音声合成を可能にすること。歌唱データの費用がかかるのを回避する。
- 音声と歌唱の両方の合成を統合的に1つのフレームワークに統合し、両タスク間でスピーカー埋め込みを共有すること。
- 音声で学習したスピーカー埋め込みが、歌唱音声変換に効果的に一般化できるかを検証すること。
- f0およびRMSEを追加入力として含めることで、歌唱音声変換の品質およびトーン類似度に与える影響を評価すること。
- スピーカーモデリングに歌唱データを一切使用しない状態で、非教師的歌唱音声変換の可能性を示すこと。
提案手法
- 音声と歌唱データの両方を用いて、DurIAN-4Sと呼ばれる統合的自己回帰モデルを学習し、同時にスピーカー埋め込みを学習する。
- 発音記号列、スピーカー埋め込み、およびフレームレベルのf0とRMSEを条件入力として用い、音声および歌唱の両方のメルスペクトログラムを生成する。
- 音声と歌唱の両タスク間で共有されるスピーカー埋め込みを活用し、音声から歌唱への転移学習を実現する。
- 学習済みモデルを、ターゲットスピーカーの埋め込みを条件として、ソースの歌唱コンテンツを入力することで、歌唱音声変換に適用する。
- マルチスプーカーのデータで微調整されたWaveRNN音声生成器を用い、合成の安定性と音質を向上させる。
- 250,000ステップにわたり、学習率をウォームアップさせるスケジュールを用い、Adam最適化法を適用する。エンコーダーとポストネットモジュールにバッチ正規化を適用する。
実験結果
リサーチクエスチョン
- RQ1通常の音声で学習したスピーカー埋め込みは、歌唱音声合成および変換に効果的に一般化できるか?
- RQ2f0およびRMSEを追加入力として含めることで、変換された歌唱音声の品質およびトーン類似度にどのような影響を与えるか?
- RQ3歌唱データが一切ない状態で、音声サンプルのみを用いた歌唱音声変換の性能が、実際に歌唱データで学習したモデルとどの程度同等に近づけるか?
- RQ4音声から得たスピーカー埋め込みを用いることで、合成された歌唱音声の自然さと類似度にどのような影響があるか?
- RQ5音声と歌唱の統合的合成フレームワークは、ペア化されたまたは平行な歌唱データを一切必要とせず、高品質な歌唱音声変換を達成できるか?
主な発見
- 歌唱データを一切使用しない状態で、音声サンプルのみを用いた歌唱音声変換が、トーン類似度の平均意見スコア(MOS)3.49、自然さのMOS3.42を達成し、優れた性能を示した。
- RMSEを追加入力として含めることで、自然さと類似度の両方が向上し、MOSは音声サンプル使用時、自然さが2.77から3.42、類似度が2.84から3.49に上昇した。
- 実際に歌唱データをターゲットにした場合、類似度のMOSは3.65、自然さのMOSは3.80に達し、音声ベースの変換が歌唱ベースの学習に非常に近い性能を示した。
- RMSEの追加により、モデルは母音の長さや音量の変化をよりよく捉えることができ、長母音における発音と発音の明瞭さが向上した。
- 本手法により、歌唱データが一切不要な状態で高品質な歌唱音声変換が可能となり、新しいボイス合成に必要なデータ量を大幅に削減できる。
- 共有されたスピーカー埋め込みフレームワークにより、音声から得たスピーカー特徴が効果的に歌唱に転送され、ターゲットスピーカーの歌唱データが一切不要な状態で効果的な音声変換が実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。