[論文レビュー] From Speaker Verification to Multispeaker Speech Synthesis, Deep Transfer with Feedback Constraint
本稿では、話者識別ネットワークをフィードバック制約として統合することで、話者アイデンティティのクローン生成を向上させるマルチスプーカーTTSシステムを提案する。合成音声の埋め込みを参照話者の埋め込みと一致させるための損失項を追加することで、EERが低く抑えられ、埋め込み空間の可視化においてもクラスタリングがタイトになることが示された。
High-fidelity speech can be synthesized by end-to-end text-to-speech models in recent years. However, accessing and controlling speech attributes such as speaker identity, prosody, and emotion in a text-to-speech system remains a challenge. This paper presents a system involving feedback constraint for multispeaker speech synthesis. We manage to enhance the knowledge transfer from the speaker verification to the speech synthesis by engaging the speaker verification network. The constraint is taken by an added loss related to the speaker identity, which is centralized to improve the speaker similarity between the synthesized speech and its natural reference audio. The model is trained and evaluated on publicly available datasets. Experimental results, including visualization on speaker embedding space, show significant improvement in terms of speaker identity cloning in the spectrogram level. Synthesized samples are available online for listening. (https://caizexin.github.io/mlspk-syn-samples/index.html)
研究の動機と目的
- エンドツーエンドのマルチスプーカーTTSシステムにおける話者アイデンティティクローン生成の改善を目的とする。
- 合成音声と自然音声の間の話者類似度のギャップ、特に未学習話者の場合のギャップを解消することを目的とする。
- 事前学習済みの識別モデルから得られる判別性の高い話者表現を転移することで、より強固なオープンセット音声クローン生成を可能とすることを目的とする。
- 合成音声と自然音声の埋め込み間の分布差を低減することを目的とする。
- データ拡張および話者識別に対するホワイトボックススプーフィング攻撃への応用を検討することを目的とする。
提案手法
- TTS学習中に事前学習済みの話者識別ネットワークをフィードバック制約として統合する。
- 識別ネットワークスコアに基づく話者類似度損失を追加し、合成音声の埋め込みを参照話者の埋め込みと一致させる。
- 合成損失とフィードバック制約損失の両方を最適化するための共同学習フレームワークを採用する。
- フィードバック制約を適用することで、合成音声の埋め込みが同じ話者クラスの自然音声の埋め込みと密にクラスタリングするよう促進する。
- 訓練の安定化を図るため、TTSアーキテクチャに残差接続と正規化層を採用する。
- 話者クローン生成のための条件ベクトルとして、識別ネットワークからの話者埋め込みを活用する。

実験結果
リサーチクエスチョン
- RQ1話者識別システムからのフィードバック制約は、マルチスプーカーTTSにおける話者アイデンティティクローン生成を向上させ得るか?
- RQ2提案手法は、合成音声と自然音声の埋め込み間の分布ギャップを低減するか?
- RQ3フィードバック制約は、学習済み話者および未学習話者の両条件において、話者類似度にどのように影響を与えるか?
- RQ4ベースラインTTSシステムと比較して、オープンセット音声クローン生成においてより優れた性能を達成できるか?
- RQ5フィードバック制約は、EERやコサイン類似度といった客観的指標にどのような影響を与えるか?
主な発見
- 提案されたフィードバック制約(FC)システムは、VCTKテストセットにおいて、テキスト依存条件下でSV-EERを50.8%相対的に低減した(14.72%から8.22%に)。
- Librispeechセットでは、テキスト依存合成においてEERを26.84%(ベースライン)から16.54%に低減し、話者識別性能が向上した。
- VCTKテストセット(テキスト依存)において、合成音声と参照埋め込み間のコサイン類似度は0.403から0.764に上昇し、話者アイデンティティの整合性が強化された。
- t-SNE可視化により、FC手法を用いた合成音声の埋め込みが自然音声の埋め込みと密にクラスタリングしているのを確認できた。これに対してベースラインでは分布シフトが顕著に観察された。
- 主観評価では、VCTKテストセットで65.8%のペア、Librispeechセットで73.7%のペアにおいてFCシステムが好まれ、より高い話者類似度が認識された。
- モデルは未学習話者に対しても高精細な音声クローン生成を可能とし、データ拡張およびホワイトボックススプーフィング攻撃への応用の可能性を示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。