[論文レビュー] DNN-based Speaker Embedding Using Subjective Inter-speaker Similarity for Multi-speaker Modeling in Speech Synthesis
本稿では、多発話者音声合成の品質を向上させるために、主観的な発話者間類似度を組み込んだDNNベースの発話者埋め込み手法を提案する。大規模なクラウドソーシングによる類似度行列を用いて訓練することで、提案手法である類似度ベクトル埋め込み法と類似度行列埋め込み法は、人間の知覚と強く相関する発話者表現を学習し、従来のd-ベクトルと比較して、未学習(オープン)発話者に対する合成音声の品質を顕著に向上させる。
This paper proposes novel algorithms for speaker embedding using subjective inter-speaker similarity based on deep neural networks (DNNs). Although conventional DNN-based speaker embedding such as a $d$-vector can be applied to multi-speaker modeling in speech synthesis, it does not correlate with the subjective inter-speaker similarity and is not necessarily appropriate speaker representation for open speakers whose speech utterances are not included in the training data. We propose two training algorithms for DNN-based speaker embedding model using an inter-speaker similarity matrix obtained by large-scale subjective scoring. One is based on similarity vector embedding and trains the model to predict a vector of the similarity matrix as speaker representation. The other is based on similarity matrix embedding and trains the model to minimize the squared Frobenius norm between the similarity matrix and the Gram matrix of $d$-vectors, i.e., the inter-speaker similarity derived from the $d$-vectors. We crowdsourced the inter-speaker similarity scores of 153 Japanese female speakers, and the experimental results demonstrate that our algorithms learn speaker embedding that is highly correlated with the subjective similarity. We also apply the proposed speaker embedding to multi-speaker modeling in DNN-based speech synthesis and reveal that the proposed similarity vector embedding improves synthetic speech quality for open speakers whose speech utterances are unseen during the training.
研究の動機と目的
- 従来のd-ベクトルが知覚的に類似した発話者を適切にモデル化できないという限界を解消するため、発話者埋め込み学習に人間が評価した発話者間類似度を統合すること。
- 訓練データに存在しない発話者(オープン発話者)に対しても効果的な多発話者音声合成を可能にするために、解釈可能で知覚的に整合性のある発話者表現を学習すること。
- 発話者埋め込みを人間の類似度知覚と一致させることで、合成音声の自然さと発話者類似度を向上させること。
提案手法
- 153名の日本語女性発話者から主観的な発話者間類似度スコアをクラウドソーシングし、大規模な主観的類似度行列を構築する。
- 2つの訓練手法を提案する:類似度ベクトル埋め込み法(各発話者について類似度ベクトルを予測するようにDNNを訓練)と、類似度行列埋め込み法(真値類似度行列とd-ベクトルのグラム行列とのFrobeniusノルムを最小化する)。
- 主観的類似度行列を教師信号として統合した修正された損失関数を用いて、DNNベースの発話者埋め込みモデルを訓練する。
- 学習された発話者埋め込みをVAEベースの多発話者音声合成システムに適用し、クローズドおよびオープン発話者における性能を評価する。
- ABおよびXAB好みテストを用いて合成音声を評価し、自然さと発話者類似度を測定する。統計的有意性検定も実施する。
実験結果
リサーチクエスチョン
- RQ1従来のd-ベクトルと比較して、DNNベースの発話者埋め込みは、人間が知覚する発話者間類似度をよりよく反映できるか?
- RQ2訓練プロセスに主観的類似度スコアを組み込むことで、オープン発話者に対する合成音声品質が向上するか?
- RQ3提案された2つの訓練手法(類似度ベクトル埋め込み法と類似度行列埋め込み法)のうち、どちらが音声合成でより優れた性能を示すか?
- RQ41人のターゲット発話者に対して類似する発話者が何人いるかという数が、類似度行列埋め込み法の性能に与える影響は何か?
- RQ5知覚的に整合性のある発話者埋め込みは、多発話者音声合成における自然さと発話者類似度の両方を向上させられるか?
主な発見
- 提案された類似度ベクトル埋め込み法は、合成音声の自然さと発話者類似度の両方を顕著に向上させ、すべてのオープン発話者において発話者類似度の好みスコアが0.517(d-ベクトルの0.483)を記録した。
- 類似度行列埋め込み法は、類似する発話者数が少ない発話者(例:F005およびF012)では発話者類似度が低下しており、類似度構造のスパarsityに敏感であることが示唆された。
- 提案手法は、従来のd-ベクトルと比較して、学習された発話者埋め込みと主観的発話者間類似度の間の相関を高めた。
- 類似度ベクトル埋め込み法は、すべてのオープン発話者に対して一貫した改善を示しており、未学習発話者への一般化性能が優れていることが示された。
- 好みテストの結果、提案された埋め込み手法は、特にオープン発話者合成において、d-ベクトルを上回る知覚的品質を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。