Skip to main content
QUICK REVIEW

[論文レビュー] Synthesizing Personalized Non-speech Vocalization from Discrete Speech Representations

Chin-Cheng Hsu|arXiv (Cornell University)|Jun 25, 2022
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本論文は、HUBERTの離散的発話ユニットを用いて、個人化された非発話的発話(NSV)を合成する音声合成フレームワークを提案する。NSVをHUBERTユニットから導出された擬似発音記号を用いたテキスト・トゥ・スピーチタスクとして扱うことで、少数のデータでの学習および多様な録音条件のもとでも、話者のトーンを制御可能なNSVの合成に成功し、NSVデータからの音声変換および話者モデリングの実現可能性を示している。

ABSTRACT

We formulated non-speech vocalization (NSV) modeling as a text-to-speech task and verified its viability. Specifically, we evaluated the phonetic expressivity of HUBERT speech units on NSVs and verified our model's ability to control over speaker timbre even though the training data is speaker few-shot. In addition, we substantiated that the heterogeneity in recording conditions is the major obstacle for NSV modeling. Finally, we discussed five improvements over our method for future research. Audio samples of synthesized NSVs are available on our demo page: https://resemble-ai.github.io/reLaugh.

研究の動機と目的

  • データの不足、即興性、標準化されていない形式の欠如により、非発話的発話(NSV)モデリングが困難であるという課題に対処すること。
  • 離散的発話表現(HUBERTユニット)が、NSV合成のための意味的で意味のあるテキストに類似した入力として機能するかどうかを調査すること。
  • 各話者に対して限られた(少数のデータ)で学習する条件下でも、話者のトーンを制御可能なNSV合成の可能性を評価すること。
  • 多様な録音条件が、話者埋め込み空間およびモデルの一般化性能に与える影響を評価すること。
  • エンド・ツー・エンドのTTSフレームワークを用いて、NSVに基づく音声変換および話者モデリングの可能性を検討すること。

提案手法

  • 事前学習済みのHUBERTモデルとK-meansクラスタリング(100クラスタ)を用いて、NSV音声を擬似発音記号に変換し、その後ランレングス符号化を適用して離散ユニットの系列を生成する。
  • 変形されたFastSpeech2アーキテクチャを用い、トランスフォーマーの代わりに拡張畳み込みを採用し、時間遅延予測器と並列ピッチデコーダーを備えて、擬似発音記号からメルスペクトログラムとピッチプロファイルを予測する。
  • 話者ラベルで条件付けられた音声モデルを用い、話者固有の合成を可能にする。話者埋め込みはバックプロパゲーションにより更新される。
  • HooliGANと呼ばれる、周期的成分とノイズ成分のモデリングに基づく神経音声生成器を用いて、予測されたメルスペクトログラムとピッチプロファイルを波形に変換する。
  • ExVoデータセット上でエンド・ツー・エンドに学習を行い、トレーニング中はアップサンプルされた擬似発音記号系列を真値のメルスペクトログラムとアラインメントさせる。
  • 任意の話者ラベルを用いた推論を可能にし、発音内容を保持したままトーンを転送する。

実験結果

リサーチクエスチョン

  • RQ1HUBERTの離散的発話ユニットは、非発話的発話(NSV)のための表現的かつ意味的な表現として十分に機能するか?
  • RQ2少数のデータで学習する条件下でも、多話者テキスト・トゥ・スピーチシステムが多様なNSVを効果的に合成し、話者アイデンティティを制御できるか?
  • RQ3多様な録音条件が、NSVモデリングにおける学習済みの話者埋め込み空間にどの程度歪みをもたらすか?
  • RQ4異なるNSVクリップ間で話者アイデンティティを転送する際、モデルは発音内容を保持しているか?
  • RQ5自己教師付き発話表現を用いたNSV合成における主な制限要因と改善の方向性は何か?

主な発見

  • HUBERTの離散的ユニット(擬似発音記号として扱う)は、さまざまなNSVの発音的コンテンツを表現するのに十分に表現力があり、異なる入力に対しても一貫した合成を可能にしている。
  • ExVo Generateベンチマークにおいて、笑いの場合は話者類似度精度が0.79、驚きの場合は0.51を達成し、ベースライン(それぞれ0.49および0.46)を著しく上回っている。
  • 合成NSVのFréchet Inception Distance(FID)は、0.52 ± 0.03(Syn-1000)および0.81 ± 0.11(Syn-100)であり、高い知覚的品質と一般化能力を示している。
  • モデルが学習した話者埋め込みは、主に録音条件(例:カットオフ周波数、コーデック、リバーブ)によって構造づけられており、話者アイデンティティよりもそれが支配的であるため、録音のばらつきが埋め込み空間を支配している。
  • モデルは、発音的内容を保持したまま、NSV間で話者のトーンを効果的に転送できており、NSVデータからの音声変換の実現可能性を確認している。
  • モデルの性能は、録音条件の多様性に起因する制限を受けており、録音効果と話者アイデンティティを分離することで、著しく耐性を向上させられると示唆されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。