[論文レビュー] Attention-Guided Generative Adversarial Network for Whisper to Normal Speech Conversion
本稿では、基本周波数推定と動的時間ワープ(DTW)アライメントの必要性を回避するため、フレームレベルでの適応的時間アライメントを実現する自己自己注意機構を用いた、Whisper-to-Normal音声変換のためのアテンション誘導型生成対抗ネットワーク(AGAN-W2SC)を提案する。モデルは優れた音声品質と聞き取りやすさを達成し、P.563スコアが1.872に達し、GMM、BLSTM、Cycle-GANといったDTWベースのベースラインを上回っている。
Whispered speech is a special way of pronunciation without using vocal cord vibration. A whispered speech does not contain a fundamental frequency, and its energy is about 20dB lower than that of a normal speech. Converting a whispered speech into a normal speech can improve speech quality and intelligibility. In this paper, a novel attention-guided generative adversarial network model incorporating an autoencoder, a Siamese neural network, and an identity mapping loss function for whisper to normal speech conversion (AGAN-W2SC) is proposed. The proposed method avoids the challenge of estimating the fundamental frequency of the normal voiced speech converted from a whispered speech. Specifically, the proposed model is more amendable to practical applications because it does not need to align speech features for training. Experimental results demonstrate that the proposed AGAN-W2SC can obtain improved speech quality and intelligibility compared with dynamic-time-warping-based methods.
研究の動機と目的
- 明示的な基本周波数(F0)推定を必要とせずに、囁き音声を通常音声に変換する課題に対処すること。
- トレーニングデータにおける動的時間ワープ(DTW)による時間アライメントの必要性を排除し、自己自己注意機構による適応的でフレームレベルのアライメントを可能にすること。
- 囁き音声スペクトルから通常音声スペクトルへの強固なマッピングを学習することで、囁き音声から通常音声への変換における音声品質と聞き取りやすさを向上させること。
- メルスペクトログ램に直接作用する柔軟でエンドツーエンドの深層学習モデルを構築すること。マルチパラメータ特徴マッピングや強制的長さアライメントを不要とする。
提案手法
- 生成対抗ネットワーク(GAN)フレームワークを採用し、U-Netに類似したエンコーダーデコーダー構造の生成器と、パッチベースの識別器を用いた対抗的学習を実施する。
- エンコーダーに自己自己注意モジュールを統合し、局所的なスペクトル特徴を適応的に重み付けすることで、囁き音声と通常音声のフレーム間での暗黙的な時間アライメントを実現する。
- 変換プロセス中にコンテンツ情報を保持するためにオートエンコーダー構造を用い、再構成精度を向上させる。
- 囁き音声と通常音声の埋め込み特徴を比較するためにシアンプス型ニューラルネットワークを採用し、識別的表現学習を支援する。
- 変換プロセス中に元の音声コンテンツを保持するため、アイデンティティマッピング損失を適用し、歪みを低減する。
- 生成器は識別器に対して3:1の比率で学習させ、収束の安定性を確保するため学習率を0.0001〜0.0002の範囲で設定する。
実験結果
リサーチクエスチョン
- RQ1深層学習モデルは、明示的な基本周波数(F0)推定に依存せずに、囁き音声を通常音声に変換できるか?
- RQ2自己自己注意機構は、囁き音声から通常音声への変換における時間的アライメントを、動的時間ワープ(DTW)に代わって効果的に果たせるか?
- RQ3フレームレベルでの学習を実施するエンドツーエンドのGANベースのアプローチは、従来のDTWアライメント手法に比べ、音声品質と聞き取りやすさの面で優れているか?
- RQ4本手法は、声帯駆動信号が欠落する囁き音声においても、人間の聴覚に自然に感じられるF0の推移を生成できるか?
主な発見
- 提案されたAGAN-W2SCモデルはP.563スコア1.872を達成し、GMM(1.163)、BLSTM(1.247)、Cycle-GAN(1.107)といったベースラインモデルを著しく上回り、優れた客観的音声品質を示している。
- AGAN-W2SCが生成する変換音声のF0曲線は、参照となる通常音声とよく一致しており、暗黙的F0生成が有効に機能していることが示された。
- 変換音声と参照音声間の基本周波数のRMSEは、ベースライン手法と同等またはそれ以上であり、無音フレームを除去した後、より高いロバスト性を示した。
- 主観的評価では、AGAN-W2SCが滑らかでより自然な音声を生成するため、RMSEが常に最低であるとは限らないが、好まれている。
- モデルは固定長の入力を必要とせず、フレームレベルで動作するため、変動する長さの囁き音声と通常音声ペairに対しても柔軟で適した設計となっている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。