[論文レビュー] DurIAN-SC: Duration Informed Attention Network based Singing Voice Conversion System
本稿では、対象話者の音声データをたった20秒分のみ用いて、高品質な歌唱ボイスを生成する統合的歌唱音声変換システムDurIAN-SCを提案する。音声合成と歌唱合成を統合した1つのフレームワークに統合することで、微調整なしにワンショット変換を実現する。事前学習済みの話者d-ベクトルネットワークを用いた話者埋め込みにより、最小限の対象データでも高い自然さと類似度を達成する。
Singing voice conversion is converting the timbre in the source singing to the target speaker's voice while keeping singing content the same. However, singing data for target speaker is much more difficult to collect compared with normal speech data.In this paper, we introduce a singing voice conversion algorithm that is capable of generating high quality target speaker's singing using only his/her normal speech data. First, we manage to integrate the training and conversion process of speech and singing into one framework by unifying the features used in standard speech synthesis system and singing synthesis system. In this way, normal speech data can also contribute to singing voice conversion training, making the singing voice conversion system more robust especially when the singing database is small.Moreover, in order to achieve one-shot singing voice conversion, a speaker embedding module is developed using both speech and singing data, which provides target speaker identify information during conversion. Experiments indicate proposed sing conversion system can convert source singing to target speaker's high-quality singing with only 20 seconds of target speaker's enrollment speech data.
研究の動機と目的
- 歌唱データが利用できない状況を想定し、対象話者のデータを極力少なくして高品質な歌唱音声変換システムを開発すること。
- 音声と歌唱合成の学習を統合的なフレームワークに統合し、データ効率を向上させること。
- 未学習話者に対して、20秒間の音声データのみでワンショット音声変換を可能にすること。
- 事前学習済み話者d-ベクトルと学習可能なLUT埋め込みの両者を比較し、歌唱音声変換における有効性を評価すること。
提案手法
- モデルは、音声と歌唱合成の両方に対して同一のDurIANベースのアーキテクチャを用い、同じ音声特徴生成フレームワークを共有する。
- 入力特徴には、テキスト/歌詞、プロソディを伴う音節列、フレームレベルのf0、および持続時間とピッチ制御のためのルート平均二乗エネルギー(RMSE)が含まれる。
- 話者アイデンティティは、対象話者の20秒間の音声または歌唱クリップから抽出した事前学習済みd-ベクトルによって符号化される。
- システムは混合音声および歌唱データで学習され、音声データが歌唱ボイス学習に寄与する。
- 自然さと類似度の両方を最適化する統合損失関数が、エンドツーエンド学習中に使用される。
- 話者d-ベクトルは、事前学習済み話者認識モデルから抽出され、メインモデルの学習とは独立して処理される。
実験結果
リサーチクエスチョン
- RQ1統合的音声および歌唱音声変換フレームワークは、音声データのみを活用して高品質な歌唱音声変換モデルを効果的に学習できるか?
- RQ2歌唱音声変換において、学習可能なLUT埋め込みと比較して、事前学習済み話者d-ベクトル埋め込みは、品質と未学習話者への一般化性能においてどのように差を示すか?
- RQ3歌唱データが不足または利用不可能な状況下で、音声データの追加が歌唱音声変換性能にどの程度寄与するか?
- RQ4事前学習済み話者埋め込みモジュールを用いて、20秒間の対象話者データのみでワンショット歌唱音声変換を達成できるか?
主な発見
- セット内話者評価において、提案されたd-ベクトルベースの話者埋め込みシステムは、自然さ(3.70 対 3.61)と類似度(3.61 対 3.56)の両面でLUTベースラインを上回った。
- セット外話者に対しては、d-ベクトル法が類似度MOS 3.10を達成し、モデルの微調整なしにワンショット変換が可能であることを示した。
- 音声データのみで学習した場合、類似度MOSは3.71、自然さMOSは3.65を記録し、混合データ(3.74 と 3.71)および歌唱専用データ(3.61 と 3.70)のベースラインと同等の性能を示した。
- 学習中に音声データを追加することで、発音の明瞭性が向上し、生成された歌唱ボイスの類似度が向上した。
- 最小限のデータで高品質な歌唱音声変換が達成されたことから、音声データが歌唱音声学習に効果的に寄与できることを確認した。
- 事前学習済みd-ベクトルモジュールにより、未学習話者へのロバストなワンショット変換が可能となり、各ユーザーごとにモデル再学習や微調整の必要がなくなった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。