[論文レビュー] Listening while Speaking: Speech Chain by Deep Learning
本論文は、ラベル付きおよびラベルなしデータを用いて、自動音声認識(ASR)および音声合成(TTS)システムを統合的に学習する深層学習ベースのクローズド・ループ音声チェーンモデルを提案する。ASRがTTSから合成された音声をトランスクリプションし、TTSがASRの出力から音声を再構築することで、相互監視を可能にすることで、ペairedデータを必要とせず両タスクの性能が向上し、ASRの語誤り率とTTSの品質指標で顕著な向上を達成した。
Despite the close relationship between speech perception and production, research in automatic speech recognition (ASR) and text-to-speech synthesis (TTS) has progressed more or less independently without exerting much mutual influence on each other. In human communication, on the other hand, a closed-loop speech chain mechanism with auditory feedback from the speaker's mouth to her ear is crucial. In this paper, we take a step further and develop a closed-loop speech chain model based on deep learning. The sequence-to-sequence model in close-loop architecture allows us to train our model on the concatenation of both labeled and unlabeled data. While ASR transcribes the unlabeled speech features, TTS attempts to reconstruct the original speech waveform based on the text from ASR. In the opposite direction, ASR also attempts to reconstruct the original text transcription given the synthesized speech. To the best of our knowledge, this is the first deep learning model that integrates human speech perception and production behaviors. Our experimental results show that the proposed approach significantly improved the performance more than separate systems that were only trained with labeled data.
研究の動機と目的
- 自動音声認識(ASR)と音声合成(TTS)の研究の間のギャップを埋めること。両者は人間の言語コミュニケーションにおいて共通の役割を果たしているが、歴史的に独立して発展してきた。
- 人間の音声チェーンメカニズム(発話者が聴覚フィードバックにより自分の発話を監視する)を模倣するため、ニューラルネットワークにクローズド・ループ学習アーキテクチャを実装すること。
- ラベル付きおよびラベルなしデータを用いて、ASRとTTSの間の相互監視を可能にすることで、両タスクの性能を向上させること。
- 単一発話者用の合成音声および複数発話者用の自然音声データセットにおいて、この統合学習フレームワークの有効性を検証すること。
提案手法
- ラベル付き音声-テキストペアとラベルなし音声またはテキストデータを用いて、ラベル付きおよびラベルなしデータの両方で交互にASRとTTSを学習する、クローズド・ループアーキテクチャを備えたシーケンス・ツー・シーケンスモデルを提案する。
- トレーニング中に教師強制(teacher-forcing)を用いる:ASRは正解トランスクリプションを用いて音声からテキストを生成し、TTSは正解テキストを用いてテキストから音声を生成する。
- 二重学習メカニズムを導入する。ASRはTTSが生成した音声からテキストを再構築し、TTSはASRが出力したテキストから音声を再構築することで、フィードバックループを形成する。
- 再構築タスクからの自己教師学習損失を活用する:合成音声に対するASR損失と再構築波形に対するTTS損失。
- ペアデータに対する教師付き損失と、非ペアデータに対する自己教師付き損失の重み付き組み合わせを採用し、ハイパーパrameter α と β がバランスを制御する。
- すべての層を凍結し、スプーカー埋め込み層のみを微調整することで、事前学習済みの単一発話者モデルを複数発話者設定に転移学習する。
実験結果
リサーチクエスチョン
- RQ1ASRとTTSを統合的に学習するフレームワークは、ラベル付きデータのみで別個に学習する場合を上回る性能を達成できるか?
- RQ2ペアデータが存在しない状況でも、ASRとTTSの間の相互監視が両システムの性能向上にどの程度効果的か?
- RQ3音声合成から認識へのフィードバックを含むクローズド・ループアーキテクチャは、ASRおよびTTSタスクのロバスト性と正確性を向上させるか?
- RQ4ハイパーパrameter α と β の異なる設定が、統合学習における性能向上に与える影響は何か?
- RQ5提案されたモデルは複数発話者設定に一般化可能であり、自然で即興的な発話の性能向上を達成できるか?
主な発見
- 提案されたクローズド・ループ音声チェーンモデルは、α=0.5 および β=1 の条件下で、複数発話者テストセットにおいて20.91%の語誤り率(WER)を達成し、ベースラインのペアデータのみを用いたモデル(26.47% WER)を上回った。
- ペアデータおよび非ペアデータの両方を用いて学習した場合、メルスペクトログ램再構築損失は10.213から9.137に、生波形損失は13.175から12.863に低下した。
- 単一発話者設定においてα=0.5にした場合、α=0.25にした場合よりも顕著な性能向上が見られた。初期モデルが精度に欠ける場合、ペアデータからの強い監視が有益であることを示している。
- 複数発話者テストセットにおいて、スプーカー認証の正確性は98.6%に達し、発話者アイデンティティの保持のロバスト性を示した。
- 非ペアデータを用いた統合学習により、ASRおよびTTSの両方で一貫した性能向上が得られ、相互フィードバックが表現学習を強化していることが示された。
- 本手法は、深層学習フレームワーク内で人間のような音声認識と発話行動を統合する最初の試みであり、エンドツーエンド音声チェーンモデリングの実現可能性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。