[論文レビュー] DeepSinger: Singing Voice Synthesis with Data Mined From the Web
DeepSinger は、スタジオ録音や手動アライメントを回避する、マルチリンガルでマルチ・シンガー向けの歌唱音声合成システムである。ウェブから抽出した歌唱データのみを用いて学習し、新しい歌詞から音声を直接生成するための画期的な歌詞-歌唱アライメントモデルと、リファレンスエンコーダーを備えたフィードフォワード・トランスフォーマーを採用することで、ノイズの多い学習データでも高いピッチ正確性と音声品質を実現した高品質な自然な歌唱音声を生成する。
In this paper, we develop DeepSinger, a multi-lingual multi-singer singing voice synthesis (SVS) system, which is built from scratch using singing training data mined from music websites. The pipeline of DeepSinger consists of several steps, including data crawling, singing and accompaniment separation, lyrics-to-singing alignment, data filtration, and singing modeling. Specifically, we design a lyrics-to-singing alignment model to automatically extract the duration of each phoneme in lyrics starting from coarse-grained sentence level to fine-grained phoneme level, and further design a multi-lingual multi-singer singing model based on a feed-forward Transformer to directly generate linear-spectrograms from lyrics, and synthesize voices using Griffin-Lim. DeepSinger has several advantages over previous SVS systems: 1) to the best of our knowledge, it is the first SVS system that directly mines training data from music websites, 2) the lyrics-to-singing alignment model further avoids any human efforts for alignment labeling and greatly reduces labeling cost, 3) the singing model based on a feed-forward Transformer is simple and efficient, by removing the complicated acoustic feature modeling in parametric synthesis and leveraging a reference encoder to capture the timbre of a singer from noisy singing data, and 4) it can synthesize singing voices in multiple languages and multiple singers. We evaluate DeepSinger on our mined singing dataset that consists of about 92 hours data from 89 singers on three languages (Chinese, Cantonese and English). The results demonstrate that with the singing data purely mined from the Web, DeepSinger can synthesize high-quality singing voices in terms of both pitch accuracy and voice naturalness (footnote: Our audio samples are shown in https://speechresearch.github.io/deepsinger/.)
研究の動機と目的
- 高価な人間による録音や手動データラベル付けを回避する歌唱音声合成システムの開発。
- 音楽ウェブサイトから直接大規模な歌唱データを収集・利用する。
- 人為的ラベルなしで音声の発音レベルに正確にアライメントをとる自動アライメントシステムの設計。
- ノイズの多い現実世界の歌唱データから学習可能な耐障害性の高い歌唱モデルの構築。
- 1つの統合モデルでマルチリンガルおよびマルチ・シンガーの合成を可能にする。
提案手法
- 複数の言語の音楽ウェブサイトから人気のある楽曲を収集するためにウェブクローリングを実施。
- 収集した音声から歌唱音声とアコーディオンを分離するために Spleeter を適用。
- 文レベルの歌詞と音声から発音レベルの持続時間予測を行う階層的アライメントモデルを学習。
- リファレンスエンコーダーを用いてシンガーのトーンをモデル化し、歌詞から直接線形スペクトログラムを生成するフィードフォワード・トランスフォーマー基盤の歌唱モデルを構築。
- 生成されたスペクトログラムから波形を再構築するために Griffin-Lim を使用。
- 中国語、広東語、英語の89人のシンガーからなる約92時間の歌唱データで学習。
実験結果
リサーチクエスチョン
- RQ1スタジオ録音や手動ラベル付けなしに、ウェブから抽出したデータのみで高品質な歌唱音声合成システムを学習可能か?
- RQ2人為的ラベルなしで代替可能な自動で複数レベルのアライメントモデルは、SVS においてどの程度有効か?
- RQ3リファレンスエンコーダーを用いたモデルは、ノイズの多い現実世界の歌唱データから、シンガー固有のトーンを効果的に学習できるか?
- RQ4マルチリンガル事前学習は、個々の言語での性能を低下させるか、向上させるか?
- RQ5TTS データのみを補助学習に用いる場合と比較して、ウェブから抽出した歌唱データを含めることは、性能にどのように影響するか?
主な発見
- DeepSinger は、合成された歌唱音声の平均意見スコア(MOS)が 3.78 に達し、基準値の 4.38 に近く、自然さが非常に高いことを示している。
- リファレンスエンコーダーを備えたモデルは、ノイズの多い学習データにおいて、特に顕著に優れた性能を示し、ノイズのある参照音声では MOS 3.27、通常のものでは 3.42 を記録した。
- ベースラインモデルと比較して DeepSinger の好みスコアは 65.00% に達し、TTS データでのみ学習したモデルの 19.50% よりも顕著に高い。これは、歌唱に特化したデータの重要性を裏付けている。
- マルチリンガル学習は、個々の言語の性能を低下させず、クロスリンガルな歌唱合成も成功裏に実現した。
- クリーンなデータで学習したモデルは、クリーンな参照音声でテストした場合、ノイズの多いデータで学習したモデルとほぼ同等の性能を示し、データのノイズに対して高い耐性を示した。
- リファレンスエンコーダーは、学習データが不完全であっても、さまざまなノイズレベルやシンガーのスタイルに一般化できる能力をモデルに与えた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。