Skip to main content
QUICK REVIEW

[論文レビュー] Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection

Lian Huang, Chi‐Man Pun|arXiv (Cornell University)|Jan 11, 2024
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本稿では、再再生およびディープフェイク音声スプーフィングを改善して検出するため、メルスペクトログ램とディープニューラルネットワーク特徴量を組み合わせたハイブリッドディープラーニングフレームワークを提案する。最大プーリングを用いたマルチレベル特徴量の統合と、自己注意機構による重要なコンponentsの強調により、ASVspoof 2021データセットにおける物理的アクセス条件下でEERが9.67%、ディープフェイク条件下で8.94%に達し、最良のベースラインをそれぞれ74.60%および60.05%上回る性能を達成した。

ABSTRACT

Due to the successful application of deep learning, audio spoofing detection has made significant progress. Spoofed audio with speech synthesis or voice conversion can be well detected by many countermeasures. However, an automatic speaker verification system is still vulnerable to spoofing attacks such as replay or Deep-Fake audio. Deep-Fake audio means that the spoofed utterances are generated using text-to-speech (TTS) and voice conversion (VC) algorithms. Here, we propose a novel framework based on hybrid features with the self-attention mechanism. It is expected that hybrid features can be used to get more discrimination capacity. Firstly, instead of only one type of conventional feature, deep learning features and Mel-spectrogram features will be extracted by two parallel paths: convolution neural networks and a short-time Fourier transform (STFT) followed by Mel-frequency. Secondly, features will be concatenated by a max-pooling layer. Thirdly, there is a Self-attention mechanism for focusing on essential elements. Finally, ResNet and a linear layer are built to get the results. Experimental results reveal that the hybrid features, compared with conventional features, can cover more details of an utterance. We achieve the best Equal Error Rate (EER) of 9.67\% in the physical access (PA) scenario and 8.94\% in the Deep fake task on the ASVspoof 2021 dataset. Compared with the best baseline system, the proposed approach improves by 74.60\% and 60.05\%, respectively.

研究の動機と目的

  • 自動発話者認証システムが再再生およびディープフェイク音声スプーフィング攻撃に対して脆弱であるという問題に取り組む。
  • 複数の音声特徴タイプからの補完的情報を活用することで、検出性能を向上させる。
  • 判別的な音声セグメントに注目する自己注意機構により、特徴表現を強化する。
  • 物理的アクセスおよびディープフェイク検出の両タスクにおいて、ASVspoof 2021データセットで最先端の性能を達成する。
  • 従来の単一特徴アプローチに比べ、ハイブリッド特徴量統合の有効性を示す。

提案手法

  • 2つの並列ストリームが、STFTを用いてメルスペクトログラム特徴量を抽出し、畳み込みニューラルネットワークを用いてディープラーニング特徴量を抽出する。
  • 両ストリームの特徴量は、顕著な情報を保持するための最大プーリング層を介して連結される。
  • 統合された特徴量に対して自己注意機構が適用され、時間的および周波数的コンponentsの動的強調が行われる。
  • 精錬された特徴量は、階層的表現学習のための残差ニューラルネットワーク(ResNet)を通過する。
  • 最終的な線形層がバイナリクロスエントロピー損失を用いてスプーフィング検出の意思決定を出力する。
  • 標準的な最適化プロトコルを用いて、ASVspoof 2021データセット上でエンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1メルスペクトログラムとディープニューラルネットワーク埋め込みを組み合わせたハイブリッド特徴量は、単一特徴ベースラインを上回るスプーフィング検出性能を実現できるか?
  • RQ2自己注意機構は、スプーフィング発話における判別的音声パターンに注目する能力をどの程度向上させるか?
  • RQ3本手法は、再再生およびディープフェイク音声検出タスクにおける等誤り率(EER)の観点から、最先端のシステムと比較してどのように差をつけるか?
  • RQ4マルチレベル特徴量の統合は、多様なスプーフィングシナリオにわたる一般化性能の向上に寄与するか?
  • RQ5モデルは、物理的アクセスおよび合成されたディープフェイク攻撃の両方に対して、一貫して高い性能を発揮できるか?

主な発見

  • 提案手法は、ASVspoof 2021データセットの物理的アクセス(PA)シナリオにおいて、等誤り率(EER)が9.67%に達した。
  • モデルはディープフェイク検出タスクにおいてEERが8.94%に達し、最良のベースラインシステムを顕著に上回った。
  • 最良のベースラインとの性能向上は、PAシナリオで74.60%、ディープフェイクタスクで60.05%であり、相対的EER低減率で測定された。
  • ハイブリッド特徴量は、周波数的特徴と学習済み表現からの補完的情報を捉えることで、より高い識別能力を提供した。
  • 自己注意機構は、スプーフィング音声の重要なセグメントを効果的に強調し、モデルのロバストネスと解釈可能性を向上させた。
  • 最大プーリングを用いたメルスペクトログラムとディープラーニング特徴量の統合により、モデルの複雑さを著しく増大させることなく、特徴表現が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。