Skip to main content
QUICK REVIEW

[論文レビュー] A Variational Prosody Model for Mapping the Context-Sensitive Variation of Functional Prosodic Prototypes

Branislav Gerazov, Gérard Bailly|arXiv (Cornell University)|Jun 22, 2018
Speech Recognition and Synthesis参考文献 46被引用数 5
ひとこと要約

本稿では、深層再帰的コントゥア生成器を用いた変分オートエンコーダーを採用し、文脈に依存する構造的で、潜在的空間表現としてのプロソディックプロトタイプを学習する、変分プロソディックモデル(VPM)を提案する。VPMは、単なる振幅スケーリングをはるかに超える多パラメトリックかつ時空間的変動を捉え、先行モデルを上回るプロソディック変動のモデリング性能を発揮するとともに、生の音声データから解釈可能で分離可能なプロソディック分解を可能にする。

ABSTRACT

The quest for comprehensive generative models of intonation that link linguistic and paralinguistic functions to prosodic forms has been a longstanding challenge of speech communication research. Traditional intonation models have given way to the overwhelming performance of deep learning (DL) techniques for training general purpose end-to-end mappings using millions of tunable parameters. The shift towards black box machine learning models has nonetheless posed the reverse problem -- a compelling need to discover knowledge, to explain, visualise and interpret. Our work bridges between a comprehensive generative model of intonation and state-of-the-art DL techniques. We build upon the modelling paradigm of the Superposition of Functional Contours (SFC) model and propose a Variational Prosody Model (VPM) that uses a network of variational contour generators to capture the context-sensitive variation of the constituent elementary prosodic contours. We show that the VPM can give insight into the intrinsic variability of these prosodic prototypes through learning a meaningful prosodic latent space representation structure. We also show that the VPM is able to capture prosodic phenomena that have multiple dimensions of context based variability. Since it is based on the principle of superposition, the VPM does not necessitate the use of specially crafted corpora for the analysis, opening up the possibilities of using big data for prosody analysis. In a speech synthesis scenario, the model can be used to generate a dynamic and natural prosody contour that is devoid of averaging effects.

研究の動機と目的

  • 文脈に依存する多パラメトリックなプロソディック変動を、分離可能で解釈可能な形でモデリングする課題に対処すること。
  • 従来の生成的プロソディックモデルと現代の深層学習の間のギャップを埋めるために、変分符号化を組み込むこと。
  • 意味的で低次元の潜在的空間表現を通じて、内在的なプロソディック変動の発見を可能にすること。
  • 特別に整備されたコーパスへの依存を減らし、大規模なデータに対してエンドツーエンドの深層学習を活用すること。
  • 音声合成における応用を支援するため、動的で平均化されていないプロソディックコントゥアを生成できること。

提案手法

  • VPMは、入力の文脈を潜在的空間に写像する変分符号化を経由する、深層ニューラルネットワークと変分コントゥア生成器を採用する。
  • 各コントゥア生成器は言語的および副言語的文脈に条件付けられており、再パラメトリゼーショントリックを用いて確率的サンプリングにおける逆誤差伝搬を可能にする。
  • 予測されたプロソディックコントゥアとターゲットコントゥアの再構成誤差を最小化するように、バックプロパゲーションを用いて同時に学習を行う。
  • 重ね合わせを用いてプロソディックを基本的な機能的プロトタイプ(clichés)に分解し、イントネーション、リズム、共話的動きの多パラメトリックモデリングを可能にする。
  • 変分推論を通じて潜在的空間を構造化し、プロソディック形状やタイミングにおける文脈特有の変動の分離可能な表現を可能にする。
  • モデルは、モールェックおよびチェンのデータベースを用いて2言語で評価され、SFC、WSFC、およびメルリンベースのベースラインと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1変分符号化を用いた深層生成モデルは、振幅スケーリングをはるかに超える文脈に依存するプロソディックプロトタイプの変動を効果的に捉えることができるか?
  • RQ2VPMは、複数の言語的および副言語的次元にわたるプロソディック変動の構造的で分離可能な潜在的空間表現をどの程度うまく学習するか?
  • RQ3VPMは、SFC や WSFC といった従来の分解型モデルおよび標準的な深層学習ベースラインと比較して、どの程度プロソディックコントゥアのモデリングで優れているか?
  • RQ4VPMは、特別に整備されたコーパスを必要とせずに、大規模で非構造的な音声データにも一般化可能か?
  • RQ5潜在的空間からのサンプリングによって、VPMは、時空間的ダイナミクスを含む内在的なプロソディック変動をどの程度明らかにできるか?

主な発見

  • VPMは、潜在的空間の最初の2つの主成分によって、プロソディックコントゥアの88%の変動を捉え、元のSFCモデルの81%を上回る。
  • VPMは、振幅スケーリングを超える形状の変動を捉える点で、重み付きSFC(WSFC)モデルを上回っており、主成分分析分解における説明される分散の高さから裏付けられている。
  • 文脈の条件付けがなくても、VPMの確率的サンプリングプロセスは意味のあるプロソディック変動を捉えているが、局所的な平均化効果によりコントゥアの振幅が低下している。
  • モデルは、宣言、疑問、感嘆などの複数の態度関数を統合したプロソディック潜在的空間を効果的に学習しており、機能的プロソディックの分離可能な表現を示している。
  • VPMは、標準的な深層学習ベースラインと同等またはそれ以上の性能を発揮するとともに、解釈可能で分離可能なプロソディック表現を提供している。
  • モデルのアーキテクチャにより、動的で平均化されていないプロソディックコントゥアの生成が可能であり、高精度な音声合成応用に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。