Skip to main content
QUICK REVIEW

[論文レビュー] DiscreTalk: Text-to-Speech as a Machine Translation Problem

Tomoki Hayashi, Shinji Watanabe|arXiv (Cornell University)|May 12, 2020
Natural Language Processing Techniques参考文献 32被引用数 21
ひとこと要約

本稿では、音声波形を離散的記号に変換する非自己回帰的VQ-VAEを用い、TTSをニューラル機械翻訳(NMT)問題として定式化する、新しいエンド・ツー・エンドの音声合成システムDiscreTalkを提案する。この手法により、自然さはVQ-VAE再構成と同等となり、ハイパーパrameterに敏感な特徴工学を回避し、過剰平滑化を軽減する非自己回帰音声合成器を用いた従来のTransformer-TTSを上回る性能を達成する。

ABSTRACT

This paper proposes a new end-to-end text-to-speech (E2E-TTS) model based on neural machine translation (NMT). The proposed model consists of two components; a non-autoregressive vector quantized variational autoencoder (VQ-VAE) model and an autoregressive Transformer-NMT model. The VQ-VAE model learns a mapping function from a speech waveform into a sequence of discrete symbols, and then the Transformer-NMT model is trained to estimate this discrete symbol sequence from a given input text. Since the VQ-VAE model can learn such a mapping in a fully-data-driven manner, we do not need to consider hyperparameters of the feature extraction required in the conventional E2E-TTS models. Thanks to the use of discrete symbols, we can use various techniques developed in NMT and automatic speech recognition (ASR) such as beam search, subword units, and fusions with a language model. Furthermore, we can avoid an over smoothing problem of predicted features, which is one of the common issues in TTS. The experimental evaluation with the JSUT corpus shows that the proposed method outperforms the conventional Transformer-TTS model with a non-autoregressive neural vocoder in naturalness, achieving the performance comparable to the reconstruction of the VQ-VAE model.

研究の動機と目的

  • 人為的に設計された音響特徴を排除した完全なエンド・ツー・エンドの音声合成システムの開発。
  • 自己回帰的TTSモデルに共通する過剰平滑化問題の解決。
  • 離散的記号列を用いることで、NMTおよびASR技術(例:ビームサーチ、サブワード単位、言語モデル)を活用すること。
  • 離散的記号ベースのTTSがVQ-VAE再構成の品質に達するかどうかの評価。
  • 離散的記号の解像度(ダウンサンプリング係数)と音声の明瞭さの品質の間のトレードオフの調査。

提案手法

  • 非自己回帰的GANベースのVQ-VAEモデルを訓練し、生の音声波形を離散的記号の系列に変換する。データ駆動型の表現を学習する。
  • VQ-VAEはベクターバリエーション機構を用い、連続的な音声を離散的トークンに埋め込むことで、正確な再構成を可能にする。
  • 入力テキストから離散的記号系列を予測するためのTransformer-NMTモデルを訓練し、TTSをシーケンス・ツー・シーケンス翻訳タスクとして扱う。
  • 離散的記号系列にサブワード単位(例:バイトペア符号化)を適用し、特に小さなダウンサンプリング係数の場合の一般化性能を向上させる。
  • 言語モデル統合(VQ-LM)を浅い融合により検討し、未翻訳音声データ上で別個に訓練されたLSTMベースのモデルを用いて生成品質を向上させる。
  • JSUTコーパスを用いてMOSと自動評価指標(CER、TER)を用い、ベースラインおよび再構成条件と比較して合成性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1生の音声のVQ-VAEベースの離散的表現は、手作業で設計された特徴を一切用いずに、高品質なエンド・ツー・エンドTTSを可能にするか?
  • RQ2TTSを機械翻訳問題として定式化することで、従来の自己回帰的モデルと比較して自然さが向上し、過剰平滑化が軽減されるか?
  • RQ3ダウンサンプリング係数(DSF)の選択が、記号解像度と音声品質のトレードオフに与える影響は何か?
  • RQ4サブワード単位および言語モデル統合は、特にデータが限られた場合に合成性能をどの程度向上させるか?
  • RQ5提案手法は、VQ-VAE再構成と同等の自然さを達成できるか?これは、ほぼ最適な性能を示していると解釈できるか?

主な発見

  • 提案されたDiscreTalkモデルは、Parallel WaveGANを用いた従来のTransformer-TTSを自然さの面で上回り、DSF128およびサブワード単位を用いた場合にMOS 3.93を達成した。
  • DSF128およびサブワード単位を用いたモデルは、MOS 3.93を達成し、ベースライン(3.48)を著しく上回り、再構成条件(4.32)に近づいた。
  • サブワード単位は、小さなダウンサンプリング係数(DSF128)の場合に特に有効であり、生の記号系列と比較して品質の低下を軽減した。
  • 浅い融合によるVQ-LMの使用は性能向上に寄与しなかったが、これはデータが限られ、NMTとVQ-LMモデルの両方で共通の訓練データが使用されたことが原因と考えられる。
  • 小さなDSF(128)は、より良い再構成品質をもたらしたが、NMTの訓練が難しくなったため、解像度と訓練安定性のトレードオフが顕在化した。
  • 合成性能と再構成性能の差が、従来のE2E-TTSモデルよりも小さく、VQ-VAEが性能の強い上限を規定している可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。