Skip to main content
QUICK REVIEW

[論文レビュー] Adversarially Trained Multi-Singer Sequence-To-Sequence Singing Synthesizer

Jie Ying Wu, Jian Luan|arXiv (Cornell University)|Jun 18, 2020
Music and Audio Processing参考文献 31被引用数 8
ひとこと要約

本論文は、多様なシンガーのデータを活用することで、限られたターゲット・シンガー用データでも音声品質を向上させる、敵対的訓練を施したマルチシンガー・シーケンス・ツー・シーケンス・シンキング・スーパーバイザーを提案する。シンガー分類器を用いてスプライサーサイド表現を低減し、複数のランダム・ウィンドウ・ディスクリミネータ(MRWDs)を用いてリアリズムと発音の明瞭さを向上させ、4.12のMOSスコアを達成。これはベースライン(3.53)を著しく上回り、特に高域の母音の明瞭さが顕著に向上した。

ABSTRACT

This paper presents a high quality singing synthesizer that is able to model a voice with limited available recordings. Based on the sequence-to-sequence singing model, we design a multi-singer framework to leverage all the existing singing data of different singers. To attenuate the issue of musical score unbalance among singers, we incorporate an adversarial task of singer classification to make encoder output less singer dependent. Furthermore, we apply multiple random window discriminators (MRWDs) on the generated acoustic features to make the network be a GAN. Both objective and subjective evaluations indicate that the proposed synthesizer can generate higher quality singing voice than baseline (4.12 vs 3.53 in MOS). Especially, the articulation of high-pitched vowels is significantly enhanced.

研究の動機と目的

  • カスタム・シンキング・ボイスのための訓練データが限られるという課題に対処し、複数のシンガー間でデータを共有する形でマルチシンガー訓練を可能にする。
  • 楽譜やボーカル録音の分布が不均一であることに起因する、シンガー間でのデータのアンバランスを緩和する。
  • 敵対的訓練を用いて、特に高域の母音についてのリアリズムと発音の明瞭さを向上させ、合成音声の質を向上させる。
  • フィードフォワード・シーケンス・ツー・シーケンス・トランスフォーマー・アーキテクチャをマルチシンガー設定に拡張することで、推論時間と露呈バイアスを低減する。
  • スプライサーサイド表現の分離とGANベースの生成を用いることで、最小限のターゲット・シンガー用データで高品質でパーソナライズされたシンキング・ボイス合成を実現する。

提案手法

  • トレーニング可能なシンガー埋め込みを用いて、シーケンス・ツー・シーケンス・トランスフォーマーに基づくシンキング・スーパーバイザーを複数のシンガーに対応可能に拡張する。
  • エンコーダー出力からのスプライサーサイド・アイデンティティ情報の最小化を目的として、敵対的ヘッドとしてのシンガー分類器を導入し、スプライサーサイドに依存しない表現学習を促進する。
  • 複数のランダム・ウィンドウ・ディスクリミネータ(MRWDs)を、生成された音響特徴の局所的セグメントに適用し、多様な時間スケールにおける細かいリアリズム評価を可能にする。
  • MRWDsは、全音声のランダムに抽出された部分列を対象として、条件付きおよび非条件付きディスクリミネータのアンサンブルとして動作し、一般化と多様性の向上を図る。
  • 音声の持続時間モデリングとスペクトル品質の焦点を分離するために、真値の発音記号持続時間とWORLD音声合成器の特徴(MGC、BAP、F0)を用いる。
  • 敵対的訓練は、シンガー分類器とMRWDsを統合したGANフレームワークにより実施され、スプライサーサイドに依存しない符号化とリアリスティックな音響生成の両方を最適化する。

実験結果

リサーチクエスチョン

  • RQ1ターゲット・シンガー用のデータが限られる状況下で、マルチシンガーのデータでトレーニングされたシーケンス・ツー・シーケンス・シンキング・スーパーバイザーが、単一シンガーのベースラインよりも優れた音声品質を達成できるか?
  • RQ2シンガー分類器による敵対的訓練は、エンコーダー出力におけるスプライサーサイド表現を効果的に低減し、シンガー間でのデータアンバランスを緩和できるか?
  • RQ3複数のランダム・ウィンドウ・ディスクリミネータ(MRWDs)は、単一ディスクリミネータのGANと比較して、生成された音響特徴のリアリズム向上と過剰平滑化の低減に寄与するか?
  • RQ4本手法は、シンキング・スーパーバイズで知られる課題である高域母音の発音明瞭さをどの程度向上できるか?
  • RQ5シンガー分類器とMRWDsを組み合わせることで、主観的および客観的評価指標において相乗効果が得られるか?

主な発見

  • 提案手法は、平均意見評価(MOS)で4.12を達成し、ベースラインシステム(3.53)を著しく上回り、優れた音声品質を示した。
  • A/B preferenceテストでは、p < 0.001の有意差が確認され、特に高域母音の発音明瞭さにおいて、シンガー分類器を搭載したシステムに顕著な利点があった。
  • シンガー分類器とMRWDsの組み合わせ(System5)は、高域母音(例:'qi a_h nn_h')に対して明確な高調波を有する最もクリアなメルスペクトログラムを生成した。
  • MRWDsは、真値に近いグローバル分散(GV)トレースを示すことで、生成特徴の過剰平滑化を効果的に低減した。
  • マルチシンガー・モジュールは、ターゲット・シンガー用データが少ない状況でも性能向上をもたらし、単一シンガーのベースラインと同等またはそれ以上のGVとMOSスコアを達成した。
  • シンガー分類器はGVにほとんど影響を及ぼさなかったが、特に高域の発音記号のようなスパarsな入力条件下で、明確に主観的品質を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。