Skip to main content
QUICK REVIEW

[論文レビュー] Learning robust speech representation with an articulatory-regularized variational autoencoder

Marc-Antoine Georges, Laurent Girin|arXiv (Cornell University)|Apr 7, 2021
Speech Recognition and Synthesis参考文献 34被引用数 4
ひとこと要約

本稿では、EMAデータから得られる発音運動軌道に従うように潜在空間の一部を制約することにより、音声表現学習を向上させるアーティキュレーター正則化変分オートエンコーダー(AR-VAE)を提案する。従来のVAEと比較して、訓練収束が早くなり、再構成誤差が低減し、音声ノイズ除去性能も向上する。発音運動に関する事前知識を組み込むことで、よりロバストで効率的な音声表現学習が実現可能であることが示された。

ABSTRACT

It is increasingly considered that human speech perception and production both rely on articulatory representations. In this paper, we investigate whether this type of representation could improve the performances of a deep generative model (here a variational autoencoder) trained to encode and decode acoustic speech features. First we develop an articulatory model able to associate articulatory parameters describing the jaw, tongue, lips and velum configurations with vocal tract shapes and spectral features. Then we incorporate these articulatory parameters into a variational autoencoder applied on spectral features by using a regularization technique that constraints part of the latent space to follow articulatory trajectories. We show that this articulatory constraint improves model training by decreasing time to convergence and reconstruction loss at convergence, and yields better performance in a speech denoising task.

研究の動機と目的

  • 変分オートエンコーダーにおける深層音声表現の学習を、事前発音運動知識によって加速・改善できるかどうかを調査すること。
  • 発音運動制約を組み込むことで、ノイズの多い条件下でも学習された表現のロバスト性が向上するかどうかを評価すること。
  • 生理的音声発生知識を潜在空間学習に統合する発音運動・音響連合モデリングフレームワークを構築すること。
  • 発音運動正則化が、音声再構成品質およびノイズ除去性能に与える影響を評価すること。

提案手法

  • 発音運動パラメータ(下顎、舌、唇、口蓋)のEMAデータを2名の基準話者から取得し、そのデータを用いて発音運動モデルを学習し、発音運動パrameterから声道形状およびスペクトル特徴へのマッピングを実現する。
  • 音声音声から抽出したスペクトル特徴(18次Barkスケールケプストラム係数)を用いて、変分オートエンコーダー(VAE)を学習する。
  • 潜在空間の一部が学習済みの発音運動軌道に従うようにするため、VAEの損失関数に正則化項を導入し、発音運動ダイナミクスと整合性を保つ。
  • 正則化には、潜在コードと予測発音運動パラメータ間の重み付き再構成誤差を用い、ハイパーパrameter α が制約の強さを制御する。
  • 収束速度および再構成誤差をモニタリングしながら、訓練を実施し、従来のVAEをベースラインとして評価する。
  • 複数のSNRレベルで、HMMベースの発音デコード精度およびMUSHRA主観品質スコアを用いて、音声ノイズ除去性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1事前発音運動知識を用いることで、音声表現学習のためのVAEの訓練プロセスが加速するか?
  • RQ2発音運動制約を組み込むことで、ノイズの多い音声条件下でも学習された表現のロバスト性が向上するか?
  • RQ3再構成品質および収束速度の観点から、AR-VAEは従来のVAEと比べてどのように異なるか?
  • RQ4発音運動正則化は、ノイズ除去タスクにおける再構成音声信号の主観的品質を向上させられるか?

主な発見

  • AR-VAEは、従来のVAEと比較して収束が早く、収束時の再構成誤差も低く抑えられ、訓練時間が顕著に短縮された。
  • 0 dB SNRにおける音声ノイズ除去タスクでは、AR-VAEが発音デコード精度を12.5ポイント向上(78.3% → 90.8%)し、p < 0.001であった。
  • MUSHRAスコアでは、クリア音声およびSNR = 10 dBで統計的に有意な改善(p < 0.001)が確認されたが、SNR = 5 dBおよび0 dBでは有意差は認められなかった。
  • AR-VAEは、特にフォルマント遷移および発音運動ダイナミクスを保持する点で、スペクトル再構成の忠実度が優れていた。
  • α = 1の正則化が最良の性能を示し、音響的および発音運動的制約のバランスが最適であったことが示唆された。
  • 結果から、発音運動事前知識が、潜在空間における学習済み音声表現の分離性および解釈可能性を向上させていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。