Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Attacks on GMM i-vector based Speaker Verification Systems

Xu Li, Jinghua Zhong|arXiv (Cornell University)|2019. 11. 08.
Speech Recognition and Synthesis참고 문헌 28인용 수 11
한 줄 요약

이 논문은 GMM i-vector 기반의 화자 확인 시스템이 빠른 기울기 부호 방법(FGSM)을 사용한 적대적 공격에 취약함을 조사하며, 조작된 적대적 샘플이 시스템 성능을 심각하게 떨어뜨린다는 것을 입증한다. 또한 이러한 적대적 샘플이 x-vector 기반 시스템으로도 이식 가능하다는 점을 보여주며, 다양한 화자 확인 아키텍처 간에 심각한 보안 위험을 드러낸다.

ABSTRACT

This work investigates the vulnerability of Gaussian Mixture Model (GMM) i-vector based speaker verification systems to adversarial attacks, and the transferability of adversarial samples crafted from GMM i-vector based systems to x-vector based systems. In detail, we formulate the GMM i-vector system as a scoring function of enrollment and testing utterance pairs. Then we leverage the fast gradient sign method (FGSM) to optimize testing utterances for adversarial samples generation. These adversarial samples are used to attack both GMM i-vector and x-vector systems. We measure the system vulnerability by the degradation of equal error rate and false acceptance rate. Experiment results show that GMM i-vector systems are seriously vulnerable to adversarial attacks, and the crafted adversarial samples prove to be transferable and pose threats to neuralnetwork speaker embedding based systems (e.g. x-vector systems).

연구 동기 및 목표

  • GMM i-vector 기반 화자 확인 시스템의 적대적 공격에 대한 취약성을 평가하기 위해.
  • GMM i-vector 시스템에서 생성된 적대적 샘플이 x-vector 기반 시스템으로 이식 가능한지 조사하기 위해.
  • FGSM를 사용하여 화자 확인 시스템에 대한 화이트박스 및_BLK박스 공격의 효과성을 평가하기 위해.
  • 적대적 변형이 EER 및 FAR와 같은 핵심 성능 지표에 미치는 영향을 측정하기 위해.
  • 재현 가능성과 향후 화자 확인의 적대적 강건성 연구를 위해 오픈소스 코드를 제공하기 위해.

제안 방법

  • 등록 및 테스트 음성 쌍에 대한 점수 함수로 GMM i-vector 시스템을 수식화한다.
  • 테스트 음성에 대해 적대적 변형을 최적화하기 위해 빠른 기울기 부호 방법(FGSM)을 적용한다.
  • GMM i-vector 및 x-vector 시스템 양쪽에서 화자 유사도 점수 산정에 PLDA 백엔드를 사용한다.
  • 제어된 ε 값으로 선형 예측 coding(LPC) 및 MFCC 특징을 변형하여 적대적 샘플을 생성한다.
  • 원본 및 적대적 오디오 샘플 간의 청각 유사도를 평가하기 위해 ABX 테스트를 활용한다.
  • GMM i-vector 및 x-vector 시스템에 대해 화이트박스 공격(시스템 전체 액세스 가능)과 블랙박스 공격(대체 모델 사용)을 수행한다.

실험 결과

연구 질문

  • RQ1GMM i-vector 기반 화자 확인 시스템은 적대적 공격에 얼마나 취약한가?
  • RQ2GMM i-vector 시스템에서 생성된 적대적 샘플이 x-vector 기반 시스템을 성공적으로 공격할 수 있는가?
  • RQ3다양한 공격 설정(예: 크로스 특징, 크로스 모델)에서 적대적 공격의 성능는 어떻게 변하는가?
  • RQ4적대적 샘플이 인간 청취자에게 원본 오디오와 구별하기 어려운 정도는 어느 정도인가?
  • RQ5변형 크기(ε)를 증가시킬수록 항상 공격 효과성이 향상되는가?

주요 결과

  • 화이트박스 FGSM 공격에서 ε = 1일 때, GMM i-vector 시스템의 오류 수용률(FAR)이 90% 증가하여 높은 취약성을 보였다.
  • ABX 테스트 결과 51.5%의 정확도를 기록하여 인간 청취자가 적대적 샘플을 원본 오디오와 구별할 수 없음을 확인했다.
  • 블랙박스 공격에서 크로스 특징 설정(LPMS-ivec → MFCC-ivec)에서 FAR이 최대 60% 증가하여 강력한 이식 가능성을 입증했다.
  • 크로스 특징-모델 공격(LPMS-ivec → MFCC-xvec)에서는 FAR이 30% 증가하여 i-vector에서 x-vector 시스템으로의 이식 가능성을 확인했다.
  • 최적 값 이외의 ε(예: ε = 5, 10)로 증가시킬 경우 공격 효과성이 감소함을 확인하였으며, 이는 과도한 변형이 노이즈로 작용해 성능 저하를 악화시키기 때문이다.
  • 고 ε 값에서 EER 값이 약 50%로 수렴함을 통해 시스템이 노이즈 유사 변형으로 인해 분류 능력을 상실함을 나타냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.