Skip to main content
QUICK REVIEW

[論文レビュー] Measuring the Effectiveness of Voice Conversion on Speaker Identification and Automatic Speech Recognition Systems

Gokce Keskin, Tyler Lee|arXiv (Cornell University)|May 29, 2019
Speech Recognition and Synthesis参考文献 20被引用数 6
ひとこと要約

本稿は、自動話者識別(SID)システムにおける標的話者の模倣能力および自動音声認識(ASR)の訓練データ拡張の観点から、Cycle-GANに基づく音声変換(VC)の有効性を評価している。SIDシステムにおいて最大46%のトップ1正答率を達成したが、ASR訓練にVCで生成された合成データを追加しても、単語誤り率(WER)および文字誤り率(CER)の向上はわずかにとどまり、強力なスタイル模倣にもかかわらずASRのデータ拡張としての有効性は限定的であることが示された。

ABSTRACT

This paper evaluates the effectiveness of a Cycle-GAN based voice converter (VC) on four speaker identification (SID) systems and an automated speech recognition (ASR) system for various purposes. Audio samples converted by the VC model are classified by the SID systems as the intended target at up to 46% top-1 accuracy among more than 250 speakers. This encouraging result in imitating the target styles led us to investigate if converted (synthetic) samples can be used to improve ASR training. Unfortunately, adding synthetic data to the ASR training set only marginally improves word and character error rates. Our results indicate that even though VC models can successfully mimic the style of target speakers as measured by SID systems, improving ASR training with synthetic data from VC systems needs further research to establish its efficacy.

研究の動機と目的

  • 自動話者識別(SID)システムが検出する範囲で、Cycle-GANベースの音声変換が標的話者を効果的に模倣できるかどうかを評価すること。
  • 合成音声変換データが自動音声認識(ASR)システムの訓練データ拡張として効果的に機能するかどうかを調査すること。
  • 異なるSIDシステムアーキテクチャ(i-vectorベースとディープラーニングベース)が音声変換音声にどのように反応するかを比較すること。
  • VCで生成された合成データの量を変化させた場合、ASRモデルの誤り率(WERおよびCER)にどのような影響を与えるかを評価すること。
  • 合成データを用いた場合に、高水準のSID分類正答率と顕著なASR向上が得られない理由を理解すること。

提案手法

  • 291人の話者で訓練されたCycle-GANベースの音声変換器を用い、並行データやテキストトランスクリプトを必要とせずに、ソース発話音声を標的話者のスタイルに変換する。
  • 4つの独立したSIDシステム(2つのi-vectorベースおよび2つのディープラーニングベース)を用いて、変換された音声サンプルを分類し、模倣の成功度を測定する。
  • ASRシステムは、Librispeechのtrain-clean-100データセットから選択された16人の話者を対象に、Deep Speech 2アーキテクチャを用いて訓練する。実データと変換済み発話音声を用いる。
  • 合成データは、選択された16人の話者間で発話音声を変換することで生成され、内容の多様性を高めつつ言語的コンテンツを保持する。
  • 訓練データセットに最大400%の合成データを追加し、ホールドアウトされたテストセットを用いてWERおよびCERでASR性能を評価する。
  • 2つの評価シナリオを比較する:実テスト発話に対して直接推論を行う方法と、訓練時の話者スタイルに合わせてテスト発話を変換した後で推論を行う方法。

実験結果

リサーチクエスチョン

  • RQ1Cycle-GANベースの音声変換器は、自動話者識別(SID)システムが測定する範囲で、標的話者を効果的に模倣できるか?
  • RQ2音声変換データを訓練データ拡張として用いる場合、自動音声認識(ASR)モデルの性能はどの程度向上するか?
  • RQ3異なるSIDシステムアーキテクチャ(i-vector対比ディープラーニング)は、音声変換音声にどのように反応するか?
  • RQ4合成音声変換データの量を増やした場合、ASRモデルの性能は一貫して向上するか?
  • RQ5なぜ、音声変換音声のSID分類正答率が高水準であるにもかかわらず、ASRの向上が顕著でないのか?

主な発見

  • 音声変換器は、291人の候補者の中から意図した標的話者としての分類において最大46%のトップ1正答率を達成し、強力なスタイル模倣を示した。
  • 一部のSIDシステムではトップ10正答率が70%を超えており、複数の自動分類器において一貫した模倣が実現していることが示された。
  • ディープラーニングベースのSIDモデルは、i-vectorモデルよりも変換音声を標的話者として分類する確率が高かったため、微細な音声アーティファクトにより敏感である可能性がある。
  • ASR訓練データセットに合成音声変換データを追加しても、単語誤り率(WER)および文字誤り率(CER)の向上はわずかにとどまり、100%を超えるとその恩恵は消失した。
  • テスト発話を訓練時の話者スタイルに合わせて事前に変換してからASR推論を行う「変換後推論」アプローチでは、直接推論を行う場合と比較して誤り率が顕著に高くなった。これは、このアプローチが効果的でないことを示している。
  • 結果から、高水準のSID分類正答率にもかかわらず、合成音声変換データはASR訓練に顕著な利益をもたらさないことが示された。合成データの品質およびモデルの整合性に関するさらなる研究が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。