Skip to main content
QUICK REVIEW

[논문 리뷰] Spotting adversarial samples for speaker verification by neural vocoders

Haibin Wu, Po‐Chun Hsu|arXiv (Cornell University)|2021. 07. 01.
Speech Recognition and Synthesis참고 문헌 44인용 수 5
한 줄 요약

이 논문은 자동 음성 인식(ASV)에서 시간 도메인의 적대적 샘플을 탐지하기 위한 새로운 방법을 제안한다. 신경 음성 합성기(neural vocoders)를 활용해 오디오를 재합성하고, 원본 및 재합성 오디오 간의 ASV 점수 차이를 측정한다. 이 방법은 모든 설정에서 Griffin-Lim 기반 기준선을 능가하며, 데이터셋에 종속되지 않는 강력한 오픈소스 솔루션을 제공한다.

ABSTRACT

Automatic speaker verification (ASV), one of the most important technology for biometric identification, has been widely adopted in security-critical applications. However, ASV is seriously vulnerable to recently emerged adversarial attacks, yet effective countermeasures against them are limited. In this paper, we adopt neural vocoders to spot adversarial samples for ASV. We use the neural vocoder to re-synthesize audio and find that the difference between the ASV scores for the original and re-synthesized audio is a good indicator for discrimination between genuine and adversarial samples. This effort is, to the best of our knowledge, among the first to pursue such a technical direction for detecting time-domain adversarial samples for ASV, and hence there is a lack of established baselines for comparison. Consequently, we implement the Griffin-Lim algorithm as the detection baseline. The proposed approach achieves effective detection performance that outperforms the baselines in all the settings. We also show that the neural vocoder adopted in the detection framework is dataset-independent. Our codes will be made open-source for future works to do fair comparison.

연구 동기 및 목표

  • 자동 음성 인식(ASV) — 중요한 생체 인식 시스템 — 에서 증가하는 적대적 공격 위협을 해결하기 위해.
  • ASV 보안 분야에서 거의 탐색되지 않은 분야인 시간 도메인의 적대적 샘플을 탐지하기 위한 메커니즘을 개발하기 위해.
  • 다양한 데이터셋에 효과적이고 일반화 가능한 신경 음성 합성기 기반 탐지 프레임워크를 제안하기 위해.
  • Griffin-Lim 알고리즘을 기준 방법으로 구현하여 비교 기준을 마련하기 위해.
  • 코드를 공개함으로써 공정한 평가와 향후 연구를 가능하게 하기 위해.

제안 방법

  • 방법은 신경 음성 합성기를 사용해 원본 오디오 입력을 새로운 웨이브폼으로 재합성한다.
  • 원본 및 재합성 오디오 샘플에 대해 각각 ASV 점수를 계산한다.
  • 두 ASV 점수 간의 절대 차이를 적대적 샘플과 진짜 샘플을 구분하는 탐지 점수로 사용한다.
  • 프레임워크는 새로운 데이터셋에 대해 재학습이 필요 없이 훈련 및 평가되므로, 데이터셋에 종속되지 않는다.
  • 비교를 위한 기준선으로 Griffin-Lim 알고리즘을 구현하였으며, 학습 없이 위상 재구성을 사용한다.
  • 이 방법은 적대적 편향이 자연적인 오디오 구조를 손상시켜 재합성 후 더 큰 점수 차이를 유도한다는 사실에 기반한다.

실험 결과

연구 질문

  • RQ1신경 음성 합성기 기반의 재합성은 시간 도메인의 적대적 샘플을 음성 인식에서 효과적으로 탐지할 수 있는가?
  • RQ2제안된 방법은 Griffin-Lim 기준선에 비해 적대적 샘플 탐지에서 어떻게 성능을 냈는가?
  • RQ3신경 음성 합성기 방법의 탐지 성능은 다양한 데이터셋에서 안정적인가?
  • RQ4신경 음성 합성기 탐지 프레임워크는 새로운 데이터에 대해 재학습 없이 일반화 가능한가?
  • RQ5원본 및 재합성 오디오 간의 점수 차이가 적대적 조작의 신뢰할 수 있는 지표가 될 수 있는가?

주요 결과

  • 제안된 신경 음성 합성기 기반 탐지 방법은 모든 실험 설정에서 Griffin-Lim 기준선을 능가한다.
  • 탐지 성능은 재학습 없이도 다양한 데이터셋에 적용해도 안정적이며, 데이터셋에 종속되지 않는다는 점을 확인한다.
  • 원본 및 재합성 오디오 간의 ASV 점수 차이는 진짜 샘플과 적대적 샘플을 강력하게 구분할 수 있다.
  • 이 방법은 이전에 거의 탐색되지 않은 분야인 시간 도메인의 적대적 공격 탐지에 효과적임을 입증한다.
  • 프레임워크는 수정 없이 다양한 오디오 데이터셋에 일반화하여 적용 가능하다.
  • 저자는 신경 음성 합성기를 적대적 기계 학습에서 음성 인식을 위한 탐지 원천으로 사용하는 것이 가능하다고 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.