Skip to main content
QUICK REVIEW

[論文レビュー] Can we steal your vocal identity from the Internet?: Initial investigation of cloning Obama's voice using GAN, WaveNet and low-quality found data

Jaime Lorenzo-Trueba, Fuming Fang|arXiv (Cornell University)|Mar 2, 2018
Speech Recognition and Synthesis被引用数 6
ひとこと要約

本稿では、インターネット上の低品質で公開可能な音声データを用いてバークハーグ・オバマの声をクローンする可能性を調査している。まず、GANベースの音声強調モデルを用いて音声品質を向上させ、その後、最先端のテキスト音声変換(TTS)およびボイスコンバージョン(VC)システムを訓練している。結果として、音声品質と話者類似度の両面で顕著な向上が得られたが、知覚的アーティファクトと低い話者類似度スコアが残っており、現行のシステムは人間の声に匹敵する自然さと同一性の忠実度にはまだ到達していないことが示された。

ABSTRACT

Thanks to the growing availability of spoofing databases and rapid advances in using them, systems for detecting voice spoofing attacks are becoming more and more capable, and error rates close to zero are being reached for the ASVspoof2015 database. However, speech synthesis and voice conversion paradigms that are not considered in the ASVspoof2015 database are appearing. Such examples include direct waveform modelling and generative adversarial networks. We also need to investigate the feasibility of training spoofing systems using only low-quality found data. For that purpose, we developed a generative adversarial network-based speech enhancement system that improves the quality of speech data found in publicly available sources. Using the enhanced data, we trained state-of-the-art text-to-speech and voice conversion models and evaluated them in terms of perceptual speech quality and speaker similarity. The results show that the enhancement models significantly improved the SNR of low-quality degraded data found in publicly available sources and that they significantly improved the perceptual cleanliness of the source speech without significantly degrading the naturalness of the voice. However, the results also show limitations when generating speech with the low-quality found data.

研究の動機と目的

  • インターネット上に公開されている低品質な音声データを用いて、効果的なボイスクローンシステムを訓練できるかどうかを評価すること。
  • 制御されていない環境からの劣化した音声を改善できる、堅牢なGANベースの音声強調モデルを開発すること。
  • 強化された低品質データから生成された合成音声の知覚的品質と話者類似度を評価すること。
  • これらの合成音声が、既存のスプーフィング防止対策を回避できるかどうかを検証すること。
  • 次世代のASVspoofデータセットに、公開済みの低品質なデータソースを含めるべきかどうかを検討すること。

提案手法

  • SNR(信号対雑音比)と知覚的品質の両面で、公開ソースの低品質でノイズの多い音声を向上させるために、変更を加えたSEGANベースの音声強調モデルを訓練した。
  • ジェネレータはスキップ接続を用いて残差強調を学習し、クリアな音声を完全から生成する負担を軽減した。
  • ジェネレータはベースライン強調モデルで事前学習され、初期段階の訓練ではクリアな音声ではなく、ベースライン出力との損失を計算した。
  • テキスト音声変換(TTS)およびボイスコンバージョン(VC)モデルは、強化された音声を用いて訓練され、単語言語および二語言語の両方の設定が含まれた。
  • 合成音声の検出可能性を評価するために、CQCC-GMMのスプーフィング防止分類器を用い、ASVspoof2015およびVCC2016データセットで訓練した。
  • 知覚的評価は、MOS(平均意見スコア)の聴取テストを用い、合成音声とコピーサイニスティック音声、自然音声を比較して行った。

実験結果

リサーチクエスチョン

  • RQ1GANベースの音声強調システムは、制御されていない環境からの低品質で公開可能な音声の品質を効果的に向上させることができるか?
  • RQ2強化された低品質データから生成された合成音声は、どれほど高い知覚的品質とターゲット話者への類似度を達成できるか?
  • RQ3強化された入手音声で訓練された最新のTTSおよびボイスコンバージョンシステムは、既存のスプーフィング防止対策に対してどれほど効果的か?
  • RQ4データ品質とトレーニングデータ選択が、ボイスクローンシステムの性能に与える影響は何か?
  • RQ5大規模かつ多様なデータセットで学習された音声強調モデルは、さまざまな録音条件に一般化できるか?

主な発見

  • GANベースの音声強調モデルは、低品質な入手音声のSNRを顕著に向上させ、自然さを損なわずに知覚的クリアネスを向上させた。
  • 知覚的評価では、強化された音声が、処理されていない低品質データに比べ、品質および自然さのMOSスコアが高かった。
  • 強化データで訓練されたTTSおよびVCシステムは、元の低品質データで訓練されたものよりも高い知覚的品質を達成したが、話者類似度は依然として低く(例:コピーサイニスティックでは2.63、WaveNetベースのTTSでは2.45)、維持された。
  • リバーブの追加により、WaveNetで生成された音声の知覚的品質が向上したが、話者類似度に顕著な改善は見られなかった。
  • CQCC-GMMに基づくスプーフィング防止対策は、高いEER(例:VCC2016セットでのTT3では0.79%)を達成しており、高度な強調と合成にもかかわらず、合成音声は依然として検出可能であることが示された。
  • VCシステムはTTSを上回り、品質および類似度の両面で優れており、VC2(単語言語)はVCC2016で訓練された対策に対してEERが0.00%を記録しており、合成音声の高い検出可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。