[論文レビュー] Multi-target Voice Conversion without Parallel Data by Adversarially Learning Disentangled Audio Representations
本論文は、教師ありデータを必要とせず、条件付きオートエンコーダーと adversarial 学習を用いて話者に依存しない言語的コンテンツと話者IDを分離することで、1つのモデルで複数話者への音声変換を実現する敵対的フレームワークを提案する。本手法は残差リファインメントネットワークを用い、高い品質でシャープなスペクトルを実現し、自然さと話者類似度が向上した。20人のターゲット話者を用いた定量的・定性的な評価によって検証された。
Recently, cycle-consistent adversarial network (Cycle-GAN) has been successfully applied to voice conversion to a different speaker without parallel data, although in those approaches an individual model is needed for each target speaker. In this paper, we propose an adversarial learning framework for voice conversion, with which a single model can be trained to convert the voice to many different speakers, all without parallel data, by separating the speaker characteristics from the linguistic content in speech signals. An autoencoder is first trained to extract speaker-independent latent representations and speaker embedding separately using another auxiliary speaker classifier to regularize the latent representation. The decoder then takes the speaker-independent latent representation and the target speaker embedding as the input to generate the voice of the target speaker with the linguistic content of the source utterance. The quality of decoder output is further improved by patching with the residual signal produced by another pair of generator and discriminator. A target speaker set size of 20 was tested in the preliminary experiments, and very good voice quality was obtained. Conventional voice conversion metrics are reported. We also show that the speaker information has been properly reduced from the latent representations.
研究の動機と目的
- 教師ありデータを必要とせず、1つのモデルで複数のターゲット話者への音声変換を可能にすること。
- 音声表現における言語的コンテンツと話者IDを分離し、堅牢な音声変換を実現すること。
- 残差信号リファインメントによって過剰に滑らかになるのを防ぎ、スペクトルのシャープネスを向上させることで音声品質を向上させること。
- 敵対的学習と話者識別器を用いて潜在表現における話者IDの分離を強制する有効性を検証すること。
- 先行する教師なし手法と比較して、客観的指標および主観的評価の両面で優れた性能を示すこと。
提案手法
- 入力音声を話者に依存しない潜在表現にエンコードするための条件付きオートエンコーダーを訓練し、ターゲット話者埋め込みを用いてデコーダーが元のスペクトログラムを再構築する。
- エンコーダーとともに敵対的に訓練される補助的話者識別器を導入し、潜在表現から話者特徴を除去することを保証する。
- 段階2に、デコーダー出力のスペクトルのシャープネスと知覚的品質を向上させるための、残差信号を生成する第2のジェネレータ・ディスクラミネーター対を導入する。
- 残差信号は要素ごとの和算でデコーダー出力に加算され、ディスクラミネーターはターゲット話者特徴を保持するように補助的話者識別器とともに訓練される。
- 2段階の訓練を実施する:まずオートエンコーダーと識別器を事前訓練し、次に5:1の比率で残差ジェネレータとディスクラミネーターを共同で訓練することで学習の安定化を図る。
- 再構築損失には平均絶対誤差(MAE)を、最適化には学習率0.0001、ベータ値(0.5, 0.9)を用いたAdamを使用する。
実験結果
リサーチクエスチョン
- RQ1教師ありデータを必要とせず、1つの音声変換モデルが複数のターゲット話者に一般化可能か?
- RQ2話者識別器を用いた敵対的学習により、潜在表現における話者IDと言語的コンテンツの分離はどの程度達成可能か?
- RQ3残差信号リファインメントは、変換音声の知覚的品質とスペクトルのシャープネスを顕著に向上させるか?
- RQ4教師ありデータを用いない状況で、Cycle-GAN-VCと比較して本手法は自然さと話者類似度の面で優れているか?
- RQ5スペクトログラムのグローバル分散は、音声変換における知覚的音声品質の信頼できる代理指標として機能するか?
主な発見
- 評価されたすべての手法の中で、本手法が最高のグローバル分散(M2M: 0.0394、M2F: 0.0401、F2M: 0.0389、F2F: 0.0333)を達成し、優れたスペクトルのシャープネスを示した。
- 主観的評価では、段階2の残差リファインメントが自然さと話者類似度の両方を顕著に向上させ、段階1のみの結果を上回った。
- 教師ありデータを用いないにもかかわらず、Cycle-GAN-VCと同等またはそれ以上の自然さと話者類似度を達成した。
- 潜在表現における話者検証精度は、識別器なしでは0.916から、識別器ありでは0.451に低下し、話者IDの有効な分離が確認された。
- スペクトログラムの可視化と人間の好みテストにより、本モデルは性別を越えたおよび性別内での話者対についても、高い知覚的品質で音声変換を成功させた。
- 推論時において可変長の入力をサポートしており、リカレント構造を用いた実用的導入が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。