Skip to main content
QUICK REVIEW

[論文レビュー] Light Convolutional Neural Network with Feature Genuinization for Detection of Synthetic Speech Attacks

Zhenzong Wu, Rohan Kumar Das|arXiv (Cornell University)|Sep 21, 2020
Speech Recognition and Synthesis参考文献 31被引用数 13
ひとこと要約

本論文は、自動話者認証における合成音声攻撃を検出するための軽量畳み込みニューラルネットワーク(LCNN)を提案する。真の音声特徴を学習することでその分布を保持しながら、偽物の音声を歪ませるトランスフォーマーを訓練することで、識別性能を向上させた。ASVspoof 2019ロジカルアクセスコーパスにおいて4.07%のEERを達成し、最先端の単一システムを上回った。

ABSTRACT

Modern text-to-speech (TTS) and voice conversion (VC) systems produce natural sounding speech that questions the security of automatic speaker verification (ASV). This makes detection of such synthetic speech very important to safeguard ASV systems from unauthorized access. Most of the existing spoofing countermeasures perform well when the nature of the attacks is made known to the system during training. However, their performance degrades in face of unseen nature of attacks. In comparison to the synthetic speech created by a wide range of TTS and VC methods, genuine speech has a more consistent distribution. We believe that the difference between the distribution of synthetic and genuine speech is an important discriminative feature between the two classes. In this regard, we propose a novel method referred to as feature genuinization that learns a transformer with convolutional neural network (CNN) using the characteristics of only genuine speech. We then use this genuinization transformer with a light CNN classifier. The ASVspoof 2019 logical access corpus is used to evaluate the proposed method. The studies show that the proposed feature genuinization based LCNN system outperforms other state-of-the-art spoofing countermeasures, depicting its effectiveness for detection of synthetic speech attacks.

研究の動機と目的

  • 多様で未知のTTSおよびVCシステムによって生成される合成音声攻撃を検出する課題に対処すること。
  • 真の音声と合成音声の分布的差異を活用することで、既知の攻撃タイプを超えた一般化性能を向上させること。
  • 実世界のASVシステムへの導入に適した、強力で軽量な検出システムを開発すること。
  • 真の音声分布を特徴の真正化によってモデリングすることで、スプーフ検出性能が向上することを示すこと。

提案手法

  • 真の音声特徴のみを用いて、真の音声の内在的分布を学習する特徴真正化トランスフォーマーを訓練する。
  • 真正化トランスフォーマーは、真の特徴を統計的特性を保持するドメインに写像する一方で、スプーフ特徴を歪ませてその乖離を強調する。
  • 変換された特徴を軽量畳み込みニューラルネットワーク(LCNN)分類器に供給し、スプーフ検出を実行する。
  • t-DCFおよびEERを指標として用い、ASVspoof 2019ロジカルアクセスコーパス上で手法を評価する。
  • 偽物の音声で訓練されたスプーフィングトランスフォーマーを用いた対照実験を実施し、提案手法に比べて性能が劣化することを確認した。
  • さまざまなフロントエンド特徴および分類器を用いた複数の最先端単一システムと比較した。

実験結果

リサーチクエスチョン

  • RQ1真の音声の分布をモデリングすることで、未観測の合成音声攻撃の検出が向上するか?
  • RQ2特徴の真正化(真の特徴を保持するがスプーフ特徴を歪める変換を学習する)は、スプーフ対策の性能を向上させるか?
  • RQ3ASVspoof 2019ロジカルアクセスベンチマークにおいて、提案されたFG-LCNNシステムは既存の最先端単一システムと比べてどのように差がつくか?
  • RQ4軽量CNN分類器は、真正化に基づく特徴変換によって、スプーフ検出で顕著な恩恵を受けるか?

主な発見

  • 提案されたFG-LCNNシステムは、ASVspoof 2019ロジカルアクセス評価セットで4.07%の等誤差率(EER)を達成し、チャレンジで報告されたすべての単一システムを上回った。
  • t-DCFは0.102を記録し、比較されたすべての単一システムの中で最低であり、誤検出と見逃しの両方を最小限に抑える優れた性能を示した。
  • スプーフィングトランスフォーマー(FS-LCNN)を用いた対照実験では、ベースラインのLCNNおよび提案されたFG-LCNNに比べて性能が劣化した。これにより、真の音声モデリングの有効性が裏付けられた。
  • 特徴の真正化アプローチは、真のサンプルの一貫した分布を活用することで、真の音声と合成音声の識別的ギャップを効果的に拡大した。
  • 特徴の真正化を用いたLCNNベースのシステムは、フロントエンドベースの手法や、ResNetおよびDNNの変種を含む他のディープラーニング分類器よりも、より頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。