[論文レビュー] An ASR Guided Speech Intelligibility Measure for TTS Model Selection
本論文では、入力テキストとASRデコードによる合成音声との間の電話誤り率(PER)を計算することで、音声の聞き取りやすさが最適なTTSモデルを選択する目的的指標として用いる手法を提案する。主観的評価において、訓練損失に基づく選択法を上回り、特にドメイン外のテキストジャンルを標的にした場合に顕著な聞き取りやすさの向上を示しており、ヒンディ語データで検証されたが、言語に依存しない応用が可能である。
The perceptual quality of neural text-to-speech (TTS) is highly dependent on the choice of the model during training. Selecting the model using a training-objective metric such as the least mean squared error does not always correlate with human perception. In this paper, we propose an objective metric based on the phone error rate (PER) to select the TTS model with the best speech intelligibility. The PER is computed between the input text to the TTS model, and the text decoded from the synthesized speech using an automatic speech recognition (ASR) model, which is trained on the same data as the TTS model. With the help of subjective studies, we show that the TTS model chosen with the least PER on validation split has significantly higher speech intelligibility compared to the model with the least training-objective metric loss. Finally, using the proposed PER and subjective evaluation, we show that the choice of best TTS model depends on the genre of the target domain text. All our experiments are conducted on a Hindi language dataset. However, the proposed model selection method is language independent.
研究の動機と目的
- 音声の聞き取りやすさに基づくTTSモデル選択のための、客観的でスケーラブルかつ人間の知覚と相関する指標の欠如に取り組む。
- TTSモデル選択において、訓練目的の損失(例:MSE)と人間が感じる音声の聞き取りやすさの間の相関が低い問題を克服する。
- 入力テキストとASRでデコードされた合成音声との間のPERが、聞き取りやすさを焦点にしたTTSモデル選択の信頼性の高い言語に依存しない目的的指標として機能するかを調査する。
- モデル選択がターゲットドメインのテキストジャンルにどのように依存するかを評価する。特に、ドメイン内とドメイン外のテスト分割を比較する。
提案手法
- 固定されたボコーダーを用いてTTSシステムを学習し、訓練エポックごとにフロントエンドモデルを変更する。
- TTSモデルと同一のデータで事前学習されたASRシステムを用い、合成音声をテキストにデコードし、入力テキストとデコードされたテキストとの間の電話誤り率(PER)を計算する。
- バリデーションスプリットでPERが最小となるTTSモデルを最終モデルとして選択するが、訓練損失が最小となるモデルではない。
- 標準的な式を用いてPERを計算する:PER = (S + D + I) / N、ここでS, D, Iは置換、削除、挿入の数、Nは基準となる電話の総数である。
- ペアワイズ比較を用いた主観的聴取テストを実施し、PERに基づく選択と最小損失に基づく選択の両方で得られたモデルの聞き取りやすさの好みを評価する。
- 2つのバリデーションスプリットでのモデル性能を比較する:1つは訓練時と類似したドメイン内のテキスト(ドメイン内)で、もう1つはドメイン外のテキスト(例:57.1%の未知語を含むニュース)である。
実験結果
リサーチクエスチョン
- RQ1入力テキストとASRでデコードされた合成音声との間のPERは、より高い音声の聞き取りやすさを持つTTSモデル選択の信頼性の高い目的的指標として機能できるか?
- RQ2PERに基づくモデル選択は、人間が感じる音声の聞き取りやすさという観点から、訓練損失に基づく選択を上回るか?
- RQ3最適なTTSモデル選択は、ターゲットドメインのテキストジャンルにどのように依存するか。特に、テストデータが訓練データと異なる場合に注目する。
- RQ4提案されたPERに基づく指標は、ドメイン内とドメイン外のジャンルの両方で有効かつ一般化可能か?
主な発見
- バリデーションスプリットでPERが最小となったTTSモデルは、訓練目的損失が最小となったモデルよりも顕著に高い音声の聞き取りやすさを示した。ドメイン内テストでは、42.8%の参加者がPER選択モデルを、28.1%が損失選択モデルを好んだ。
- ドメイン外のテキスト(例:57.1%の未知語を含むニュース)では、最適なモデルはエポック550でPERに基づいて選ばれたが、最良の損失ベースモデルはエポック710で選ばれた。これは、モデル選択がテキストジャンルに依存することを示している。
- PER選択モデル(MDL-PER-ID)は18,251語中13,983語の電話を正しく検出できたが、損失選択モデル(MDL-LOSS)は13,612語にとどまった。電話検出精度の向上が明確に測定された。
- ドメイン外テストでは、48.9%の参加者がPER選択モデル(MDL-PER-OD)を損失選択モデル(MDL-LOSS)よりも好んだ。ドメイン内ケースと比較してより強い好みの傾向が見られた。
- 直接比較された際、50%の参加者がPER選択モデル(MDL-PER-OD)とドメイン内PER選択モデル(MDL-PER-ID)の両方を同程度に聞き取りやすいと評価した。これは、PERに基づく選択がドメインシフトにうまく適応できることを示している。
- ドメイン内では55種類の固有電話のうち29種類、ドメイン外では50種類の固有電話のうち29種類で、PERベースの指標が有意義な改善を示した。わずかな電話でわずかな劣化が見られたが、全体として聞き取りやすさ関連の性能向上が一貫して確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。