Skip to main content
QUICK REVIEW

[論文レビュー] Neural MOS Prediction for Synthesized Speech Using Multi-Task Learning With Spoofing Detection and Spoofing Type Classification

Yeunju Choi, Youngmoon Jung|arXiv (Cornell University)|Jul 16, 2020
Speech Recognition and Synthesis参考文献 31被引用数 4
ひとこと要約

本稿では、スプーフィング検出(SD)およびスプーフィングタイプ分類(STC)を補助タスクとして併用することで、合成音声のニューラルMean Opinion Score(MOS)予測を向上させるマルチタスク学習フレームワークを提案する。SDの学習をバランスさせるためにファクター損失を用い、ベースライン比でMOS予測精度に最大11.6%の相対的向上を達成し、レーティングのばらつきに耐性があり一般化性能に優れたモデルであることが示された。

ABSTRACT

Several studies have proposed deep-learning-based models to predict the mean opinion score (MOS) of synthesized speech, showing the possibility of replacing human raters. However, inter- and intra-rater variability in MOSs makes it hard to ensure the high performance of the models. In this paper, we propose a multi-task learning (MTL) method to improve the performance of a MOS prediction model using the following two auxiliary tasks: spoofing detection (SD) and spoofing type classification (STC). Besides, we use the focal loss to maximize the synergy between SD and STC for MOS prediction. Experiments using the MOS evaluation results of the Voice Conversion Challenge 2018 show that proposed MTL with two auxiliary tasks improves MOS prediction. Our proposed model achieves up to 11.6% relative improvement in performance over the baseline model.

研究の動機と目的

  • 主観的MOS評価における被験者間および被験者内ばらつきの課題に対処し、これにより既存のニューラルMOS予測モデルの性能が制限されることを改善すること。
  • 関連する補助タスク(スプーフィング検出(SD)およびスプーフィングタイプ分類(STC))を活用することで、MOS予測モデルの一般化性能および耐性を向上させること。
  • マルチタスク学習におけるSDとSTCの相乗効果を調査し、MOS予測のための特徴学習を強化すること。
  • ドメインシフト下で、ファクター損失がスプーフィング検出における難易度の高い例と簡単な例の間の学習ダイナミクスのバランスに与える影響を調査すること。
  • 人間のレーティング不要で自動的にシステム比較が可能な、補助タスクによるMOS予測性能の向上を実証すること。

提案手法

  • 257次元のマグニチュードスペクトログラムを入力として用い、発話単位のMOS予測を目的とするCNN-BLSTMベースのMOSNetをベースラインモデルとして採用する。
  • 2つの補助タスクを導入:二値スプーフィング検出(SD)は音声を人間発話または合成音声に分類し、スプーフィングタイプ分類(STC)は合成音声の出力元システムを特定する。
  • 発話単位およびフレーム単位のMOS予測のMSE損失、SDの交差エントロピー損失、STCの交差エントロピー損失を組み合わせたマルチタスク損失関数を用いてモデルを学習する。
  • SDヘッドにファクター損失を適用し、簡単なネガティブ例の影響を軽減し、特にドメインシフト下で難易度の高い例の学習を向上させる。
  • MOS、SD、STC予測のためのタスク固有のヘッドを備えた共有エンコーダレイヤーを全タスクに共通して使用し、特徴転送を実現する。
  • t-SNEを用いて共有特徴を可視化し、補助タスクが特徴空間に及ぼす「集中化」「無視」「区別」効果を分析する。

実験結果

リサーチクエスチョン

  • RQ1スプーフィング検出およびスプーフィングタイプ分類は、合成音声のニューラルMOS予測を向上させる有効な補助タスクとして機能するか?
  • RQ2スプーフィング検出におけるファクター損失の使用が、特にドメインシフト下でMOS予測性能に与える影響は何か?
  • RQ3補助タスクは、異なるレーティンググループおよびスプーフィングタイプにおいて、MOS予測モデルの一般化性能をどの程度向上させるか?
  • RQ4補助タスクの「集中化」「無視」「区別」効果が、学習された共有特徴表現に与える影響は何か?
  • RQ5提案されたマルチタスク学習フレームワークは、精度および耐性の観点で、最先端のMOS予測モデルを上回るか?

主な発見

  • スプーフィング検出およびスプーフィングタイプ分類を組み合わせた提案マルチタスク学習モデルは、ベースラインのMOSNetモデル比でMOS予測性能に最大11.6%の相対的向上を達成した。
  • ファクター損失を用いたスプーフィング検出は、特にドメインシフトが生じるVCC’16データセットにおいて、難易度の高い例の無視効果を軽減することで、一般化性能を顕著に向上させた。
  • スプーフィングタイプ分類の追加により特徴の識別性能が向上し、t-SNE可視化では異なるシステム由来のフレームがより明確にクラスタリングされていることが示された。
  • t-SNEプロットでは、スプーフィング検出による「集中化」効果が観察され、人間発話および高品質な合成音声のフレームが低品質なフレームからより明確に分離していた。
  • スプーフィング検出にファクター損失を適用したモデル(SD w/ FL)は、VCC’18およびVCC’16の両方で標準的なSDを上回り、簡単なネガティブ例の学習への悪影響を顕著に低減した。
  • 提案モデルは、最先端のMOSNet+ELモデルを上回り、SDおよびSTCを共同で学習させることで自動音声品質評価の有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。