Skip to main content
QUICK REVIEW

[論文レビュー] ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech

Xin Wang, Junichi Yamagishi|arXiv (Cornell University)|Nov 5, 2019
Speech Recognition and Synthesis参考文献 52被引用数 10
ひとこと要約

本論文は、論理的および物理的アクセスのシナリオにおいて合成・変換・再生された音声を含む大規模な公開データベースであるASVspoof 2019データベースを紹介する。自動音声認識(ASV)および対策システム、および人間の評価を用いて最先端のスプーフィング攻撃を評価し、一部の合成音声が人間の聴取者ですら本物の音声と区別できないことを示し、発話者認証システムにおける深刻な脆弱性を浮き彫りにした。

ABSTRACT

Automatic speaker verification (ASV) is one of the most natural and convenient means of biometric person recognition. Unfortunately, just like all other biometric systems, ASV is vulnerable to spoofing, also referred to as "presentation attacks." These vulnerabilities are generally unacceptable and call for spoofing countermeasures or "presentation attack detection" systems. In addition to impersonation, ASV systems are vulnerable to replay, speech synthesis, and voice conversion attacks. The ASVspoof 2019 edition is the first to consider all three spoofing attack types within a single challenge. While they originate from the same source database and same underlying protocol, they are explored in two specific use case scenarios. Spoofing attacks within a logical access (LA) scenario are generated with the latest speech synthesis and voice conversion technologies, including state-of-the-art neural acoustic and waveform model techniques. Replay spoofing attacks within a physical access (PA) scenario are generated through carefully controlled simulations that support much more revealing analysis than possible previously. Also new to the 2019 edition is the use of the tandem detection cost function metric, which reflects the impact of spoofing and countermeasures on the reliability of a fixed ASV system. This paper describes the database design, protocol, spoofing attack implementations, and baseline ASV and countermeasure results. It also describes a human assessment on spoofed data in logical access. It was demonstrated that the spoofing data in the ASVspoof 2019 database have varied degrees of perceived quality and similarity to the target speakers, including spoofed data that cannot be differentiated from bona-fide utterances even by human subjects.

研究の動機と目的

  • 自動発話者認証(ASV)システムにおけるスプーフィング対策の評価のための包括的ベンチマークを開発すること。
  • テキストから音声への合成、音声変換、再生攻撃の3つの主要なスプーフィング攻撃に対するASVシステムの脆弱性に対処すること。
  • 学術的および産業的リサーチのための標準化された、公開可能なデータセットを提供すること。このデータセットには、正解ラベルとメタデータが付随している。
  • 自動指標(EER)と人間評価を用いて、ASVおよび対策システムの性能を評価すること。
  • 特に物理的アクセスのシナリオにおいて、制御された音響条件下でのスプーフィング攻撃の有効性を体系的に分析すること。

提案手法

  • データベースには、最先端のニューラル音声および波形モデル(Tacotron2、WaveNet、WaveRNN)を用いて生成されたスプーフィング音声が含まれており、これらはテキストから音声への合成および音声変換に使用されている。
  • 再生攻撃は、正確なマイクおよびスピーカーの配置を伴う制御された音響環境でシミュレートされ、物理的アクセス条件の詳細な分析が可能になっている。
  • 2つのユースケースシナリオが定義された:論理的アクセス(LA)は合成/変換音声を対象とし、物理的アクセス(PA)は再生攻撃を対象としている。それぞれが異なるプロトコルと評価指標を有する。
  • スプーフィングと対策のASV信頼性への影響を評価するための新しい指標として、タンドレット検出コスト関数(t-DCF)が導入された。
  • 等誤差率(EER)およびt-DCFを用いて、データセット上でベースラインASVおよび対策(CM)システムを訓練および評価し、性能を評価した。
  • 人間の評価はLAサブセットで実施され、スプーフィング発話の知覚的品質およびターゲット発話者との類似度が評価された。

実験結果

リサーチクエスチョン

  • RQ1最先端のテキストから音声への合成および音声変換システムは、本物の音声と区別できないスプーフィング音声をどれほど効果的に生成できるか?
  • RQ2制御された音響条件下での物理的アクセスシナリオにおける再生攻撃は、ASVシステムの信頼性をどの程度損なうか?
  • RQ3自動ASVおよび対策システムは、この新しいデータセット上でどのように性能を発揮するか。また、その結果は人間の知覚とどの程度相関するか?
  • RQ4波形生成技術(例:Griffin-Lim 対 WaveRNN)は、スプーフィング音声の知覚的品質および検出可能性にどのような影響を及えるか?
  • RQ5新たに導入されたt-DCF指標は、スプーフィング攻撃下でのASVシステムの実世界における信頼性をどの程度反映しているか?

主な発見

  • WaveRNNを波形生成に用いたシステムA10のスプーフィングデータは、人間の聴取者に対しても本物の音声と区別がつかず、知覚的品質(p=0.012)および類似度(p=0.81)に有意差がなかった。
  • Griffin-Limを波形生成に用いたシステムA11は、低品質な合成音声を生成し、人間による検出が顕著に容易であった。これは、波形生成技術がスプーフィング品質に顕著に影響することを示している。
  • A10とA11の検出可能性の差は統計的に有意であった(p<0.001)。これは、波形生成技術が知覚的品質および検出可能性の両方に影響を及ぼすことを確認している。
  • 人間の評価者たちは、A13およびA17のスプーフィングデータを自動システムよりも容易に検出できた。これは、人間の知覚とベースラインASV/CM性能の間で乖離が生じていることを示している。
  • t-DCF指標は、スプーフィング攻撃がASVシステムに与える信頼性への影響を効果的に捉えており、EER単体よりも現実的で包括的な評価を可能としている。
  • ASVspoof 2019データベースには、知覚的に本物の音声と区別がつかないスプーフィング発話が含まれており、現代のTTSおよびVCシステムが人間および機械の検出を回避する能力の高さを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。