Skip to main content
QUICK REVIEW

[論文レビュー] A Spoofing Benchmark for the 2018 Voice Conversion Challenge: Leveraging from Spoofing Countermeasures for Speech Artifact Assessment

Tomi Kinnunen, Jaime Lorenzo-Trueba|arXiv (Cornell University)|Apr 23, 2018
Speech Recognition and Synthesis参考文献 6被引用数 3
ひとこと要約

本稿では、音声変換(VC)システムにおける音声アーティファクトの評価に、スプーフィング対策(CM)を目的関数として、参照なしの方法を提案する。CQCC(定常Qケプストラム係数)に基づくCMを、本物の音声と変換された音声を区別するように訓練することで、等誤差率(EER)をアーティファクト深刻度の代理指標とする。EERが低いほど、アーティファクトが顕著に検出可能であることを示す。主な発見は、VCC'18のすべてのシステムが50%のEERを達成していないこと(理想状態ではない)であり、すべてのシステムが測定可能なアーティファクトを導入していることを示しており、特にWavenetベースのシステムは高い音声品質を有するが、検出されやすいという特徴を示している。

ABSTRACT

Voice conversion (VC) aims at conversion of speaker characteristic without altering content. Due to training data limitations and modeling imperfections, it is difficult to achieve believable speaker mimicry without introducing processing artifacts; performance assessment of VC, therefore, usually involves both speaker similarity and quality evaluation by a human panel. As a time-consuming, expensive, and non-reproducible process, it hinders rapid prototyping of new VC technology. We address artifact assessment using an alternative, objective approach leveraging from prior work on spoofing countermeasures (CMs) for automatic speaker verification. Therein, CMs are used for rejecting `fake' inputs such as replayed, synthetic or converted speech but their potential for automatic speech artifact assessment remains unknown. This study serves to fill that gap. As a supplement to subjective results for the 2018 Voice Conversion Challenge (VCC'18) data, we configure a standard constant-Q cepstral coefficient CM to quantify the extent of processing artifacts. Equal error rate (EER) of the CM, a confusability index of VC samples with real human speech, serves as our artifact measure. Two clusters of VCC'18 entries are identified: low-quality ones with detectable artifacts (low EERs), and higher quality ones with less artifacts. None of the VCC'18 systems, however, is perfect: all EERs are < 30 % (the `ideal' value would be 50 %). Our preliminary findings suggest potential of CMs outside of their original application, as a supplemental optimization and benchmarking tool to enhance VC technology.

研究の動機と目的

  • 主観的聴取テストを超えた標準化された、客観的指標の欠如を解消すること。
  • 元々自動話者認証におけるスプーフィング防止を目的として開発されたスプーフィング対策(CM)が、VCにおけるアーティファクト評価のための再利用が可能かどうかを検討すること。
  • VCシステムのベンチマークに用いるための、参照なし・テキスト独立型のMOSスコアの代替案を提供すること。
  • VCC'18チャレンジにおけるCMベースのEERと主観的品質スコア(MOS)との相関関係を評価すること。
  • Wavenetを含む最新技術のVC手法が、CMを用いてどの程度のアーティファクトを検出可能にするかを特定すること。

提案手法

  • 変換音声および本物の人の声から特徴を抽出するために、標準的な定常Qケプストラム係数(CQCC)フロントエンドが使用される。
  • 入力発話が本物(bona fide)またはスプーフィング(偽装)された音声として分類できるように、ガウス混合モデル(GMM)バックエンドが訓練される。
  • 訓練されたCMの等誤差率(EER)が性能指標として計算され、EERが低いほどアーティファクトの検出可能性が高くなる。
  • EERが客観的アーティファクトスコアとして機能するように、VCC'18チャレンジのエントリをベースラインおよびチャレンジシステム出力で評価する。
  • 元の話者波形やテキストトランスクリプトにアクセスしない形で適用されるため、参照なし・テキスト独立型となる。
  • EERをVCC'18の主観的テストから得られた主観的MOSスコアと比較し、機械的評価と人間の評価の相補性を評価する。

実験結果

リサーチクエスチョン

  • RQ1スプーフィング対策は、音声変換システムにおける音声アーティファクト評価のための客観的指標として効果的に再利用可能か?
  • RQ2VCC'18データで訓練されたCMのEERは、人間の聴取者による主観的品質スコア(MOS)とどの程度相関するか?
  • RQ3CMベースのEER指標によると、どのVCシステムが最も/最も検出されにくいアーティファクトを生成するか?
  • RQ4Wavenetベースの合成のような最新のVC技術は、音声が自然に聴こえるにもかかわらず、CMによって検出可能なアーティファクトをどれほど導入するか?
  • RQ5CMベースのEERは、時間のかかる主観的評価の代替として、信頼性があり、再現可能で、かつ効率的な指標として機能するか?

主な発見

  • VCC'18のすべてのシステムが、理想的な50%のEERに達していないことから、すべてのシステムが検出可能なアーティファクトを生成しており、CMを完全に欺くことはできていない。
  • 波形フィルタリング、SuperVP、Griffin-Limベースの生成を用いたシステムは、EERが低く(性能が優れている)なっており、検出可能なアーティファクトが少ないことを示している。
  • Wavenetベースのシステムは、高いMOSスコアを示しているが、相対的に高いEERを示しており、人間の耳には明らかでないが、機械モデルでは検出可能なアーティファクトを導入していることが示唆される。
  • EER指標は特徴選択やモデル設定に敏感であることが判明し、CMの性能が訓練およびハイパーパrameterの選択に依存することを示している。
  • CMベースのEERと主観的MOSの間に強い相関は認められず、人間と機械の音声品質認識の違いが顕著であることが確認された。
  • 本研究は、ギャップを明らかにした:現在の最先端VCシステムは人間の聴取者をだませるが、必ずしもスプーフィング対策をだませないため、アーティファクト低減の余地が残っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。