Skip to main content
QUICK REVIEW

[논문 리뷰] Attacking Speaker Recognition With Deep Generative Models

Wilson Cai, Anish P. Doshi|arXiv (Cornell University)|2018. 01. 08.
Digital Media Forensic Detection참고 문헌 14인용 수 20
한 줄 요약

이 논문은 딥러닝 기반의 화자 인식 시스템을 속이는 데 성공한 새로운 GAN 기반 접근법을 제안한다. 워셔스타인 GAN 손실을 수정하여 실제 비대상 화자 데이터를 통합함으로써, 타겟 공격과 비타겟 공격을 모두 가능하게 하여 타겟 공격 성공률을 75% 향상시켰다 (오류율 0.38에서 0.12로 감소).

ABSTRACT

In this paper we investigate the ability of generative adversarial networks (GANs) to synthesize spoofing attacks on modern speaker recognition systems. We first show that samples generated with SampleRNN and WaveNet are unable to fool a CNN-based speaker recognition system. We propose a modification of the Wasserstein GAN objective function to make use of data that is real but not from the class being learned. Our semi-supervised learning method is able to perform both targeted and untargeted attacks, raising questions related to security in speaker authentication systems.

연구 동기 및 목표

  • 딥 생성 모델, 특히 GAN이 현대의 화자 인식 시스템에 효과적인 대비 공격을 생성할 수 있는지 조사하기.
  • 샘플러RNN 및 웨이브넷과 같은 기존 순차적 모델이 화자 인식 시스템에 대해 얼마나 견고한지 평가하기 (이들은 일반적으로 음성 합성에 사용됨).
  • 비타겟 화자 데이터를 포함시켜 타겟 공격 성능을 향상시키는 반감독형 GAN 기반 공격 프레임워크 개발하기.
  • 모드 붕괴와 타겟 공격의 다양성 부족 문제를 해결하기 위해, 혼합된 실제 데이터 분포를 사용하는 수정된 손실 함수 도입하기.
  • 모든 가용 화자 데이터를 기반으로 훈련된 GAN을 사용하여 비타겟 공격의 가능성 평가하기 (클래스 레이블과 무관하게)

제안 방법

  • 타겟 클래스 외에도 모든 화자로부터의 실제 음성 샘플을 통합하는 수정된 워셔스타인 GAN 목적함수 제안하여 생성기의 다양성과 공격 성능 향상시키기.
  • 다양한 화자들로부터의 실제 데이터를 결합한 혼합 손실 함수를 사용하여, WGAN-GP를 훈련시켜 현실적이고 공격용으로 적합한 멜스펙트로그램을 생성하도록 생성기 유도하기.
  • 미리 훈련된 CNN 기반 화자 확인기(수정된 AlexNet)를 사용하여 멜스펙트로그램에서 깊은 특징(1024D)을 추출하고, 공격 테스트 중 평가 및 KNN 기반 분류에 활용하기.
  • 생성된 멜스펙트로그램을 깊은 특징 공간에서 예측된 화자 정체성으로 매핑하기 위해 K=5의 K-최근접 이웃(KNN) 분류기 적용하기.
  • 기울기 페널티를 사용한 WGAN-GP 손실을 최적화하여 생성기가 실제 멜스펙트로그램과 구별되지 않는 멜스펙트로그램을 생성하도록 훈련하기.
  • 과적합 방지를 위해 훈련 중 타겟 화자 데이터에 정규분포 노이즈를 추가하여 공격 생성기의 일반화 능력 향상시키기.

실험 결과

연구 질문

  • RQ1샘플러RNN 및 웨이브넷과 같은 순차적 생성 모델이 현대의 CNN 기반 화자 인식 시스템을 속이는 데 성공적인 위조 공격을 생성할 수 있는가?
  • RQ2표준 GAN을 사용하여 멜스펙트로그램을 생성함으로써, 화자 확인기가 이를 실제 데이터로 분류하는 비타겟 공격을 어느 정도 성공적으로 수행할 수 있는가?
  • RQ3비타겟 화자 데이터를 포함하는 수정된 WGAN 손실 함수가 화자 인식 시스템에 대한 타겟 공격 성공률 향상에 기여하는가?
  • RQ4GAN 훈련 과정에 다양한 실제 음성 데이터(다양한 화자들로부터)를 통합할 경우, 생성된 공격 샘플의 품질과 현실성에 어떤 영향을 미치는가?
  • RQ5제안된 혼합 손실 함수가 타겟 화자 위조 공격에서 오류율과 공격 성공률에 미치는 정량적 영향은 무엇인가?

주요 결과

  • 샘플러RNN 및 웨이브넷이 생성한 샘플은 CNN 기반 화자 인식 시스템을 속이지 못했으며, 타겟 화자와 일치하는 예측이 전혀 없었다.
  • 혼합 손실 함수를 사용한 제안된 수정된 WGAN-GP는 타겟 공격에서 0.12의 오류율을 기록하여 기준 WGAN-GP(0.38 오류율) 대비 75% 향상된 성능을 보였다.
  • 모든 가용 화자 데이터를 기반으로 훈련된 GAN 프레임워크를 사용한 비타겟 공격은 화자 확인기가 이를 실제 데이터로 분류하는 멜스펙트로그램을 성공적으로 생성했으며, '기타' 클래스에 할당된 예측은 없었다.
  • 5000회 반복 후 시각적 점검을 통해 생성기가 데이터셋 내 모든 화자로부터의 멜스펙트로그램 특징을 학습하고 재현하는 데 성공했으며, 모드 붕괴 없이 작동했다.
  • 향상된 WGAN-GP 프레임워크는 5000회 생성기 반복 후 실제 멜스펙트로그램과 시각적으로 구별되지 않는 샘플을 생성했으며, 단일 4GB GPU에서 약 10시간 동안 훈련이 진행되었다.
  • KNN 분류기는 생성된 샘플을 깊은 특징 공간에서 가장 가까운 화자로 성공적으로 매핑하여, 타겟 및 비타겟 설정 모두에서 공격 성공률 평가가 정확하게 수행되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.