Skip to main content
QUICK REVIEW

[論文レビュー] Spotting adversarial samples for speaker verification by neural vocoders

Haibin Wu, Po‐Chun Hsu|arXiv (Cornell University)|Jul 1, 2021
Speech Recognition and Synthesis参考文献 44被引用数 5
ひとこと要約

本論文は、音声再合成のためのニューラルボコーダーを活用し、元の音声と再合成音声のASVスコアの乖離を測定することで、自動話者認証(ASV)における時間領域の adversarial サンプルを検出する新規な手法を提案する。この手法は、すべての設定でGriffin-Limベースラインを上回り、データセットに依存しない堅牢でオープンソースの解決策を提供する。

ABSTRACT

Automatic speaker verification (ASV), one of the most important technology for biometric identification, has been widely adopted in security-critical applications. However, ASV is seriously vulnerable to recently emerged adversarial attacks, yet effective countermeasures against them are limited. In this paper, we adopt neural vocoders to spot adversarial samples for ASV. We use the neural vocoder to re-synthesize audio and find that the difference between the ASV scores for the original and re-synthesized audio is a good indicator for discrimination between genuine and adversarial samples. This effort is, to the best of our knowledge, among the first to pursue such a technical direction for detecting time-domain adversarial samples for ASV, and hence there is a lack of established baselines for comparison. Consequently, we implement the Griffin-Lim algorithm as the detection baseline. The proposed approach achieves effective detection performance that outperforms the baselines in all the settings. We also show that the neural vocoder adopted in the detection framework is dataset-independent. Our codes will be made open-source for future works to do fair comparison.

研究の動機と目的

  • 自動話者認証(ASV)という重要なバイオメトリクスシステムにおける adversarial 攻撃の増加する脅威に対処すること。
  • ASV セキュリティ分野でほとんど未開拓とされる時間領域の adversarial サンプルを検出するためのメカニズムを開発すること。
  • 効果的で一般化可能な、ニューラルボコーダーに基づく検出フレームワークを提案すること。
  • Griffin-Limアルゴリズムを参照手法として実装することで、比較のための新しいベースラインを確立すること。
  • コードを公開することで、公平な評価と今後の研究を可能にすること。

提案手法

  • 手法は、元の音声入力を新しい波形に再合成するためのニューラルボコーダーを使用する。
  • 元の音声および再合成音声の両方のASVスコアを計算する。
  • 両者のASVスコアの絶対差を、adversarial と本物のサンプルを区別するための検出スコアとして使用する。
  • フレームワークは、新しいデータセットに再トレーニングすることなく訓練および評価され、データセットに依存しないことを保証する。
  • 比較のためのベースラインとして、学習なしに位相再構築を行うGriffin-Limアルゴリズムが実装されている。
  • adversarial パーティクルが自然な音声構造を破壊するため、再合成後にスコアの乖離が大きくなるという事実に依拠している。

実験結果

リサーチクエスチョン

  • RQ1ニューラルボコーダーに基づく再合成は、話者認証における時間領域の adversarial サンプルを効果的に検出できるか?
  • RQ2提案手法は、Griffin-Limベースラインと比較して、adversarial サンプルの検出においてどのように優れているか?
  • RQ3ニューラルボコーダー手法の検出性能は、さまざまなデータセットで堅牢か?
  • RQ4ニューラルボコーダー検出フレームワークは、新しいデータに再トレーニングなしで一般化可能か?
  • RQ5元の音声と再合成音声のスコア差は、adversarial マニピュレーションの信頼できる指標として機能するか?

主な発見

  • 提案されたニューラルボコーダーに基づく検出手法は、すべての実験設定でGriffin-Limベースラインを上回っている。
  • 検出性能は堅牢であり、異なるデータセットに適用しても再トレーニングが不要であることが確認され、データセットに依存しないことが裏付けられた。
  • 元の音声と再合成音声のASVスコアの差は、本物のサンプルと adversarial サンプルを強く区別する指標である。
  • この手法は、ASV分野でこれまでほとんど未開拓であった時間領域の adversarial 攻撃を効果的に同定できることを示した。
  • フレームワークは一般化可能であり、変更なしに多様な音声データセットに適用可能である。
  • 著者らは、ニューラルボコーダーを adversarial マシンラーニングにおける話者認証の検出プリミティブとして使用する可能性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。