Skip to main content
QUICK REVIEW

[論文レビュー] Variation and Synthetic Speech

Corey Miller, Orhan Karaali|arXiv (Cornell University)|Nov 17, 1997
Speech Recognition and Synthesis参考文献 15被引用数 3
ひとこと要約

本論文では、パンダイアレクト的発音辞書とトレーナブルなポストリクスカルモジュールを用いて、合成音声における言語的変異をニューラルネットワークベースの手法でモデル化するアプローチを提示している。再訓練を通じて個々の話者の発音変異を学習することで、各話者に対して膨大な手動音声ラベリングを要せずとも、合成音声の自然さが向上する。

ABSTRACT

We describe the approach to linguistic variation taken by the Motorola speech synthesizer. A pan-dialectal pronunciation dictionary is described, which serves as the training data for a neural network based letter-to-sound converter. Subsequent to dictionary retrieval or letter-to-sound generation, pronunciations are submitted a neural network based postlexical module. The postlexical module has been trained on aligned dictionary pronunciations and hand-labeled narrow phonetic transcriptions. This architecture permits the learning of individual postlexical variation, and can be retrained for each speaker whose voice is being modeled for synthesis. Learning variation in this way can result in greater naturalness for the synthetic speech that is produced by the system.

研究の動機と目的

  • 地域的および個人的な発音変異を反映した自然な合成音声を生成するという課題に対処すること。
  • 各話者に対して完全な音声表記を要しない、スケーラブルでトレーニング可能なシステムを構築し、ポストリクスカル音声変異を捉えること。
  • 個々の話者データを用いてポストリクスカルニューラルネットワークを再訓練することで、合成ボイスの話者固有の適応を可能にすること。
  • 1つの発音辞書に多様な方言を統合しつつ、合成における音声的正確性と自然さを維持すること。

提案手法

  • 文字列から音声への変換(L2S)ニューラルネットワークのトレーニングデータとして、パンダイアレクト的発音辞書が構築される。
  • L2Sモデルがテキスト入力をもとに初期発音を生成し、それがポストリクスカルニューラルネットワークに渡される。
  • ポストリクスカルモジュールは、対応する発音辞書発音と手動でラベル付けされた狭義の音声表記を用いてトレーニングされ、話者固有の音声変異をモデル化する。
  • 各ターゲット話者に対して、そのボイスデータを用いてポストリクスカルネットワークを再訓練することで、個別化された発音モデル化が可能になる。
  • システムはニューラルネットワークを活用して、入力テキストと出力音声系列の間の複雑な非線形マッピングを、話者固有の特徴を伴って学習する。
  • このアーキテクチャにより、方言および個人の変異パターンをエンドツーエンドで学習でき、合成音声の自然さが向上する。

実験結果

リサーチクエスチョン

  • RQ11つの音声合成システムが、複数の方言的発音変異を効果的にモデル化する方法は何か?
  • RQ2トレーナブルなポストリクスカルモジュールが、話者固有の音声変異をどのように捉えているか?
  • RQ3各話者に対して完全な音声注釈を要しないで、ニューラルネットワークを効果的に用いてポストリクスカル発音規則を学習・適用することは可能か?
  • RQ4各話者ごとにポストリクスカルモジュールを再訓練することで、合成音声の自然さはどのように向上するのか?

主な発見

  • 本システムは、1つの統一された発音辞書を用いて、複数の方言における言語的変異を効果的にモデル化した。
  • ポストリクスカルニューラルネットワークは、個々のボイスデータを用いた再訓練を通じて、話者固有の発音パターンを効果的に学習した。
  • ポストリクスカル処理にニューラルネットワークを用いることで、高い正確性で方言的および個人的変異に一般化することができた。
  • 各話者ごとにポストリクスカルモジュールを再訓練することで、固定ルールシステムに比べて著しく自然な合成音声が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。