[論文レビュー] Voice Imitating Text-to-Speech Neural Networks
本稿では、トランスクリプトや追加の訓練を必要とせず、6秒間の音声サンプルのみで新しい話者の声を模倣するニューラル音声合成モデルを提案する。Tacotronにスピーカー埋め込みネットワークを組み合わせることで、リアルタイムで高品質で話者固有の音声を生成する。本モデルは、複数話者向けTTSモデルと同等の音声品質を達成するとともに、多様な入力に対して即座に声を模倣可能である。
We propose a neural text-to-speech (TTS) model that can imitate a new speaker's voice using only a small amount of speech sample. We demonstrate voice imitation using only a 6-seconds long speech sample without any other information such as transcripts. Our model also enables voice imitation instantly without additional training of the model. We implemented the voice imitating TTS model by combining a speaker embedder network with a state-of-the-art TTS model, Tacotron. The speaker embedder network takes a new speaker's speech sample and returns a speaker embedding. The speaker embedding with a target sentence are fed to Tacotron, and speech is generated with the new speaker's voice. We show that the speaker embeddings extracted by the speaker embedder network can represent the latent structure in different voices. The generated speech samples from our model have comparable voice quality to the ones from existing multi-speaker TTS models.
研究の動機と目的
- 新しい話者の声を、トランスクリプトや追加の訓練を必要とせず、6秒間の短い音声サンプルのみで即座に模倣できるようにすること。
- 1つの短い音声クリップのみを用いて、ターゲット話者の声の特徴を持つ自然な音声を生成できるニューラルTTSシステムを開発すること。
- スピークァー埋め込み抽出の汎用性を検討し、音声以外の入力モodalitie(例:ビデオ)に対しても対応可能なスピークァー埋め込みネットワークの設計を試みること。
- 標準的な複数話者TTSモデルと比較して、生成音声の知覚的品質と話者識別可能性を評価すること。
提案手法
- 新しい話者の短い音声クリップからコンactなスピークァー埋め込みを抽出できるスピークァー埋め込みネットワークを訓練する。
- スピークァー埋め込みをテキスト入力と連結し、変更されたTacotronモデルに供給することで、テキストと話者の声に条件付けられた音声を生成する。
- スピークァー埋め込みネットワークとTacotronベースのTTSモデルを、声の模倣と音声生成の両方を統合最適化できるように、エンドツーエンドで微調整する。
- 主成分分析(PCA)を用いて、学習済みスピークァー埋め込みの潜在的構造を可視化し、その声の特徴を捉える能力を評価する。
- アマゾンMechanical Turkを活用したクラウドソーシング調査を実施し、提案モデルとベースラインの複数話者TTSモデルとの間で、音声品質と話者識別可能性を定量的に比較する。
- スピークァー埋め込みネットワークを、感情に配慮した音声合成を可能にするために、ビデオなどのマルチモーダル入力へも拡張可能であるように設計する。
実験結果
リサーチクエスチョン
- RQ1トランスクリプトや追加の訓練を必要とせず、6秒間の音声サンプルのみでニューラルTTSモデルが新しい話者の声を模倣できるか?
- RQ2提案された声の模倣TTSの音声品質は、標準的な複数話者TTSモデルと比べてどの程度か?
- RQ3最小限のデータで学習した場合でも、生成音声が話者の個性をどの程度保持できるか?
- RQ4スピークァー埋め込みネットワークは、ビデオなどの他の入力モダリティへも一般化可能か?これによりマルチモーダル音声合成が可能になるか?
主な発見
- クラウドソーシング調査において、提案された声の模倣TTSモデルは平均スコア-0.10 ± 1.16を達成し、複数話者TTSベースラインと顕著な知覚的差がないことを示した。
- 声の模倣TTSの話者識別正確度は60.1%であり、50%のランダムベースラインを著しく上回っており、生成音声が識別可能な話者の特徴を保持していることを示している。
- 複数話者TTSモデルは70.5%の高い話者識別正確度を達成しており、ゼロショット模倣アプローチに比べ、より大規模で多様なデータセットで学習している利点が顕著に現れている。
- PCAの可視化により、スピークァー埋め込みネットワークが異なる声の潜在的構造を効果的に表現していることが確認された。
- 再訓練を必要とせず、即座に声の模倣が可能であるため、最小限の入力でリアルタイムアプリケーションに適している。
- 本アプローチは、顔の動画などのマルチモーダル入力へも拡張可能であり、感情や文脈に配慮した音声合成への応用が期待される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。