[論文レビュー] End-to-End Whisper to Natural Speech Conversion using Modified Transformer Network
本稿では、フレームレベルの発音子予測のための補助デコーダーを統合し、並列および非並列データを活用することで、強化されたTransformerベースのエンドツーエンドフレームワークを、囁き音声から自然な発音への変換のために提案する。変換された音声をエンドツーエンドASRシステムに供給した場合、wTIMITおよびCHAINSデータセットにおいて語誤り率(WER)が65%相対的に低減され、新規のフォルマント分散誤差指標を用いて、フォルマント分布が真値に非常に近い結果が得られた。
Machine recognition of an atypical speech like whispered speech, is a challenging task. We introduce whisper-to-natural-speech conversion using sequence-to-sequence approach by proposing enhanced transformer architecture, which uses both parallel and non-parallel data. We investigate different features like Mel frequency cepstral coefficients and smoothed spectral features. The proposed networks are trained end-to-end using supervised approach for feature-to-feature transformation. Further, we also investigate the effectiveness of embedded auxillary decoder used after N encoder sub-layers, trained with the frame-level objective function for identifying source phoneme labels. We show results on opensource wTIMIT and CHAINS datasets by measuring word error rate using end-to-end ASR and also BLEU scores for the generated speech. Alternatively, we also propose a novel method to measure spectral shape of it by measuring formant distributions w.r.t. reference speech, as formant divergence metric. We have found whisper-to-natural converted speech formants probability distribution is similar to the groundtruth distribution. To the authors' best knowledge, this is the first time enhanced transformer has been proposed, both with and without auxiliary decoder for whisper-to-natural-speech conversion and vice versa.
研究の動機と目的
- エンドツーエンドASRにおける機械の理解性を向上させるために、囁き音声を自然な発音に変換すること。
- 特異な発音認識におけるデータ不足問題に対処するため、並列および非並列の両方の学習データを活用すること。
- 訓練中にフレームレベルの発音子認識を可能にする、埋め込み型補助デコーダーを標準Transformerアーキテクチャに統合すること。
- E2E ASRにおけるWERとフォルマント分散誤差指標によるスペクトル類似度を用いて、提案モデルの有効性を評価すること。
- 自然音声から囁き音声への逆方向変換能力を示すため、二次的な実験として自然音声から囁き音声への変換を実装すること。
提案手法
- N個のエンコーダー部分の後段に補助デコーダーを挿入した強化されたTransformerネットワークを提案し、フレームレベルの発音子分類タスクを目的関数として訓練する。
- モデルはシーケンス・トゥ・シーケンスの特徴変換を実行し、k個の入力フレーム(囁き音声)をk個の出力フレーム(自然な発音)に変換することで、オンライン変換を実現する。
- 評価対象の特徴タイプとして、メル周波数ケプストラム係数(MFCCs)と平滑化されたスペクトル特徴を検討したが、MFCCsが優れた性能を示した。
- データ不足を緩和するため、並列および非並列データの両方を用いて、教師あり学習によりエンドツーエンドでモデルを訓練する。
- スペクトル形状の類似度は、フォルマントF1~F4のガウス・ミックスチャネル・モデル(GMMs)間のKLダイバージェンスに基づく、新規のフォルマント分散誤差指標(FDM)を用いて測定する。
- 評価のため、変換された音声特徴から自然な音声を合成するため、WORLD音声合成器を用いる。
実験結果
リサーチクエスチョン
- RQ1補助デコーダーを備えた強化されたTransformerは、標準モデルと比較して、囁き音声から自然な発音への変換品質を向上させることができるか?
- RQ2並列および非並列データを組み合わせることで、低リソースな特異な発音認識環境において、モデル性能が顕著に向上するか?
- RQ3変換された音声が、スペクトル類似度で測定した場合、どの程度ターゲット音声のフォルマント分布を保持しているか?
- RQ4E2E ASRシステムでデコードされた場合、変換された音声の性能は元の囁き音声と比較してどうなるか?
- RQ5提案されたアーキテクチャは、逆方向タスク(自然音声から囁き音声への変換)に対しても効果的に適用可能であり、双方向変換能力を示せるか?
主な発見
- MFCCベースで補助デコーダーを備えたW2モデルは、E2E ASRシステムでテストしたwTIMITデータセットにおいて、語誤り率(WER)を65%相対的に低減し、元の囁き音声と比べて顕著に優れた性能を示した。
- CHAINSデータセットでは、W2モデルはベースラインの囁き入力と比較して、WERを約65%相対的に低減したが、挿入誤り率の上昇により全体の精度がわずかに低下した。
- wTIMITテストセットではW2モデルがBLEUスコア85.36、CHAINSでは62.68を達成し、生成音声の文法的自然さと意味的類似度の両方が高いことを示した。
- フォルマント分散誤差指標(FDM)では、W2モデルが生成した音声の分散誤差(F1: 0.1034)が、ベースラインのW1(F1: 0.1543)よりも低く、スペクトル忠実度が優れていることを示した。
- 補助デコーダーは性能向上に顕著な寄与を示し、W2およびV2モデル(補助デコーディングを有効にした)は、W1およびV1(補助デコーディングなし)と比較して、WERおよびFDM両方の指標で優れた結果を示した。
- スペクトログラムおよびフォルマント解析から、W2モデルが生成した音声が、特にF1およびF2において、自然な発音のスペクトルエンVELOープおよびフォルマントトレースをよく模倣していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。