Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time, Universal, and Robust Adversarial Attacks Against Speaker Recognition Systems

Yi Xie, Cong Shi|arXiv (Cornell University)|2020. 03. 04.
Adversarial Robustness in Machine Learning참고 문헌 15인용 수 11
한 줄 요약

이 논문은 DNN 기반 다중 클래스 화자 인식 시스템에 대한 실시간, 보편적이고 강건한 타겟 공격을 위한 최초의 공격을 제안한다. 단일의 음성에 의존하지 않는 보편적 편향을 생성하고, 실내 음향 왜곡을 실내 임펄스 응답(RIR) 추정을 통해 모델링함으로써, 공격 성공률가 90% 이상을 기록하면서도 비보편적 방법보다 100배 빠른 배포 속도를 확보한다.

ABSTRACT

As the popularity of voice user interface (VUI) exploded in recent years, speaker recognition system has emerged as an important medium of identifying a speaker in many security-required applications and services. In this paper, we propose the first real-time, universal, and robust adversarial attack against the state-of-the-art deep neural network (DNN) based speaker recognition system. Through adding an audio-agnostic universal perturbation on arbitrary enrolled speaker's voice input, the DNN-based speaker recognition system would identify the speaker as any target (i.e., adversary-desired) speaker label. In addition, we improve the robustness of our attack by modeling the sound distortions caused by the physical over-the-air propagation through estimating room impulse response (RIR). Experiment using a public dataset of 109 English speakers demonstrates the effectiveness and robustness of our proposed attack with a high attack success rate of over 90%. The attack launching time also achieves a 100X speedup over contemporary non-universal attacks.

연구 동기 및 목표

  • 다중 클래스 DNN 기반 화자 인식 시스템에 대해 실시간, 보편적이고 강건한 공격이 부족한 문제를 해결하기 위해.
  • 각 음성에 맞게 최적화가 필요한 기존의 개별 공격 방식이 실시간 사용에 부적합한 문제를 해결하기 위해.
  • 실내 환경에서의 공격 강건성을 높이기 위해 실내 임펄스 응답(RIR) 추정을 활용해 공기 중 음향 왜곡을 모델링하기 위해.
  • 단일의 재사용 가능한 편향을 사용해 어떤 화자도 선택한 타겟 화자로 오인 식별하도록 하기 위해.
  • 실제 음향 조건에서 109명의 화자로 구성된 공개 데이터셋을 대상으로 높은 효과성과 효율성을 입증하기 위해.

제안 방법

  • 입력 음성 콘텐츠와 무관한 보편적 편향을 설계하여, 어떤 등록된 화자의 발화에도 적용 가능하도록 하기 위해.
  • 고정 길이의 보편적 노이즈를 반복 재생하여, 길이가 변하는 음성 입력에 적응시키기 위해.
  • 모의 음향 환경에서 실내 임펄스 응답(RIR)을 추정하여 물리적 공기 중 왜곡을 모델링하기 위해.
  • RIR 추정 채널 응답을 사용해 보편적 적대적 편향을 훈련시켜 실제 재생 시 강건성을 향상시키기 위해.
  • 타겟 공격 목적 함수를 사용해 보복 화자를 정해진 타겟 화자로 잘못 식별하도록 편향을 최적화하기 위해.
  • 신호 대 잡음비(SNR) 지표를 디벨로드(dB) 단위로 사용해 편향의 미세함을 정량화하여 청각적으로 거의 인식되지 않는 왜곡을 확보하기 위해.

실험 결과

연구 질문

  • RQ1일관된 보편적 적대적 편향을 설계하여 최신 DNN 기반 화자 인식 시스템이 어떤 화자도 타겟 화자로 잘못 식별하도록 유도할 수 있는가?
  • RQ2실내 음향 왜곡, 예를 들어 실내 반사 및 전파에 의해 유도되는 왜곡에 노출되었을 때 공격의 효과는 어떠한가?
  • RQ3기존의 개별 적대적 공격 방법보다 훨씬 빠른 속도로 실시간으로 공격를 수행할 수 있는가?
  • RQ4RIR 기반 모델링이 실제 환경 배포 시나리오에서 적대적 예제의 강건성을 얼마나 향상시키는가?
  • RQ5실제 음향 조건 하에서 편향 강도(노이즈 수준)와 공격 성공률 사이의 상호 교환 관계는 어떠한가?

주요 결과

  • 제안된 보편적 공격는 -18.84 dB의 노이즈 수준에서 평균 99.95%의 공격 성공률를 기록하여 높은 효과성을 입증하였다.
  • 매우 낮은 노이즈 수준인 -33.96 dB에서도 평균 성공률가 80% 이상을 유지하여, 거의 인식되지 않는 편향임을 시사한다.
  • RIR 기반 강건성 훈련을 통해 실내 시뮬레이션에서 평균 성공률가 90.19%를 기록한 반면, RIR 모델링이 없는 경우는 단지 1.33%에 그쳤다.
  • 공격 실행 시간은 0.015초로 단축되어 기존의 비보편적 공격 방식(1회당 약 15초 소요)보다 100배 빠른 속도를 확보하였다.
  • 109명의 화자에 대해 성공적으로 일반화되었으며, 다양한 음성 입력에 대해 편향의 보편성과 확장 가능성을 확인하였다.
  • 결과적으로 RIR 추정이 물리적 환경에서의 강건성을 크게 향상시켜 실제 배포 환경에서의 공격 가능성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.