[論文レビュー] AttS2S-VC: Sequence-to-Sequence Voice Conversion with Attention and Context Preservation Mechanisms
本稿では、時間に同期された並列データや発音記号ラベルを必要とせず、音声スペクトルエンVELOープ、基本周波数の連続、および発話時間のエンドツーエンド変換を可能にする、アテンションおよびコンテキスト保持機構を備えたシーケンス・ツー・シーケンス音声変換モデルAttS2S-VCを提案する。この手法は、1枚のGPUを用いて1日間で学習が完了し、GMMベースのVCを上回り、LSTM-TTSの性能に匹敵する優れた音声品質を達成する。
This paper describes a method based on a sequence-to-sequence learning (Seq2Seq) with attention and context preservation mechanism for voice conversion (VC) tasks. Seq2Seq has been outstanding at numerous tasks involving sequence modeling such as speech synthesis and recognition, machine translation, and image captioning. In contrast to current VC techniques, our method 1) stabilizes and accelerates the training procedure by considering guided attention and proposed context preservation losses, 2) allows not only spectral envelopes but also fundamental frequency contours and durations of speech to be converted, 3) requires no context information such as phoneme labels, and 4) requires no time-aligned source and target speech data in advance. In our experiment, the proposed VC framework can be trained in only one day, using only one GPU of an NVIDIA Tesla K80, while the quality of the synthesized speech is higher than that of speech converted by Gaussian mixture model-based VC and is comparable to that of speech generated by recurrent neural network-based text-to-speech synthesis, which can be regarded as an upper limit on VC performance.
研究の動機と目的
- 時間に同期された並列データに依存せずに、安定的かつ高速に学習を実行できる音声変換システムの開発。
- 1つのエンドツーエンドフレームワーク内でスペクトルエンVELOープ、基本周波数の連続、および発話時間の共同変換を可能にすること。
- 学習中に発音記号ラベルや言語的トランスクリプトを必要としないこと。
- 最小限の監視情報で、最先端の音声合成システムと同等の高品質な音声変換を達成すること。
提案手法
- 長さが異なる入力・出力シーケンス間のアライメントを実現するため、アテンション機構を備えたエンコーダ・デコーダアーキテクチャを採用する。
- デコーディング中に関連するソースフレームに注目させるよう促すために、ガイド付きアテンション損失を導入する。
- 変換中にソース音声の時間的および周波数的コンテキストを維持するために、コンテキスト保持損失を適用する。
- WORLD音声合成器を用いて抽出された生の音響特徴(メル倒頻スペクトル係数、log-F0、非周期性)を用いてエンドツーエンドで学習する。
- 停止トークンを生成することで、出力の長さを可変にし、可変長出力生成を可能にする。
- λ_cp、λ_ga、σ_g などのハイパーパrameterを調整し、コンテキスト保持、アテンションガイド、学習安定性のバランスをとる。
実験結果
リサーチクエスチョン
- RQ1アテンションおよびコンテキスト保持機構を備えたシーケンス・ツー・シーケンスモデルは、時間に同期された並列データがなくても、安定的かつ高速に学習を実行できるか?
- RQ2本モデルは、発音記号ラベルやトランスクリプトを必要とせずに、スペクトルエンVELOープ、F0連続、および発話時間の共同変換を実現できるか?
- RQ3提案手法は、従来のGMMベースのVCシステムよりも優れた音声品質を実現するか?
- RQ4提案手法の性能は、自然さと話者類似度の観点で、最先端のエンドツーエンド音声合成システムと比較してどうなるか?
主な発見
- 15名の被験者による主観的好みテストの結果、提案されたAttS2S-VCモデルは、自然さと話者類似度の両面でGMMベースのVCを上回った。
- LSTMベースの音声合成システムと同等の音声品質を達成しており、これは音声変換性能の上限と見なされる。
- 1枚のNVIDIA Tesla K80 GPUを用いて1日間で学習が完了し、高い学習効率を示した。
- 従来のフレーム/シーケンスベースのVCシステムとは異なり、本手法はスペクトル特徴に加え、F0連続および発話時間の両方を効果的に変換できた。
- 発音記号ラベルや時間に同期されたソース・ターゲット音声ペアを一切必要としないため、生の音声シーケンスからの完全なエンドツーエンド学習が可能となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。