[논문 리뷰] Inaudible Adversarial Perturbations for Targeted Attack in Speaker Recognition
이 논문은 청각적 주파수 마스킹을 활용한 청각적으로 감지되지 않는 변형을 사용하여 x-vector 기반의 화자 인식 시스템에 대상 지정형 화이트박스 공격을 제안한다. 표준 lp-노름 제약 조건 대신 인간 청각 마스킹 임계값 이하로 변형을 제약함으로써, 청취자에게 감지되지 않으면서도 최대 98.5%의 공격 성공률을 달성한다. 이는 음악과 같은 비음성 음원에 적용되어도 성립한다.
Speaker recognition is a popular topic in biometric authentication and many deep learning approaches have achieved extraordinary performances. However, it has been shown in both image and speech applications that deep neural networks are vulnerable to adversarial examples. In this study, we aim to exploit this weakness to perform targeted adversarial attacks against the x-vector based speaker recognition system. We propose to generate inaudible adversarial perturbations achieving targeted white-box attacks to speaker recognition system based on the psychoacoustic principle of frequency masking. Specifically, we constrict the perturbation under the masking threshold of original audio, instead of using a common l_p norm to measure the perturbations. Experiments on Aishell-1 corpus show that our approach yields up to 98.5% attack success rate to arbitrary gender speaker targets, while retaining indistinguishable attribute to listeners. Furthermore, we also achieve an effective speaker attack when applying the proposed approach to a completely irrelevant waveform, such as music.
연구 동기 및 목표
- 사람 청취자에게 감지되지 않도록 하는 대상 지정형 x-vector 기반 화자 인식 시스템 공격 기법을 개발한다.
- 청각적 원리에 기반한 방법을 활용해 lp-노름 기반 변형의 한계를 극복하고 청각적 음성 감지 가능성을 향상시킨다.
- 음성 및 비음성 파형(예: 음악)에 대해 주파수 마스킹 기반 변형의 효과성을 평가한다.
- 기존의 lp-노름 기반 방법과 비교해 주관적 품질 및 공격 성능을 평가한다.
- 음악과 같은 관련 없는 음원 입력에 대해 고성공률의 대상 공격이 가능한지를 입증한다.
제안 방법
- x-vector 화자 인식 모델에 대해 대상 지정형 화이트박스 공격 프레임워크를 사용해 악성 변형을 생성한다.
- 원본 오디오 신호의 청각 마스킹 임계값 이하로 변형을 제약하기 위해 청각적 주파수 마스킹을 적용하여 청각적으로 감지되지 않도록 보장한다.
- 목표 화자 레이블에 대해 교차 엔트로피 손실을 최소화하기 위해 기울기 기반 최적화를 사용해 변형을 최적화한다.
- 원본 오디오의 스펙트럼 에너지에서 유도된 마스킹 임계값을 사용해 변형의 범위를 정의하며, lp-노름 제약 조건을 대체한다.
- 주관적 ABX 선호도 테스트와 객관적 지표(PESQ, SNR)를 사용해 변형의 청각 유사도를 평가한다.
- 공격을 MUSAN 코퍼스에서 얻은 음악과 같은 비음성 입력으로 확장하여 방법의 일반화 및 강건성을 테스트한다.
실험 결과
연구 질문
- RQ1주파수 마스킹 기반 변형은 lp-노름 기반 방법보다 대상 지정형 화자 인식 공격에서 더 높은 성공률을 달성할 수 있는가?
- RQ2에너지가 더 클 수 있음에도 불구하고, 주파수 마스킹 기반 악성 변형은 lp-노름 기반 변형보다 더 청각적으로 감지되지 않는가?
- RQ3음악과 같은 비음성 오디오에 적용했을 때 청각적으로 감지되지 않는 악성 변형이 화자 인식 시스템에 효과적으로 공격할 수 있는가?
- RQ4주관적 청취 테스트에서 주파수 마스킹 기반 변형의 청각 품질은 lp-노름 기반 변형과 비교해 어떻게 되는가?
- RQ5다양한 화자 대상 조합(M2M’, F2F’ 등)에 대해 다양한 테스트 모드에서 제안된 방법의 성능은 어떠한가?
주요 결과
- 제안된 주파수 마스킹 기반 방법은 Aishell-1 코퍼스의 모든 테스트 모드에서 최대 98.5%의 공격 성공률를 기록했으며, lp-노름 기반 기준선보다 뚜렷하게 높았다.
- 주관적 ABX 선호도 테스트에서 68.67%의 청취자가 주파수 마스킹 기반 악성 예제를 lp-노름 기반 예제보다 선호하여 더 뛰어난 청각적 음성 감지 회피 능력을 확인했다.
- 절대 에너지가 더 큰 것으로 나타났음에도 불구하고, 주파수 마스킹 기반 변형은 원본 음성과 더 유사하게 평가되어 개선된 청각적 투명성을 확인했다.
- MUSAN 코퍼스의 음악 파형에 적용했을 때도 91.5%의 공격 성공률를 기록하여, 완전히 관련 없는 비음성 입력에 대해서도 효과적임을 입증했다.
- 객관적 지표로는 lp-노름 기반 변형이 약간 더 높은 PESQ와 SNR를 기록했지만, 주관적 결과는 주파수 마스킹 기반 변형이 실제 적용 시 더 청각적으로 감지되지 않는다는 것을 확인했다.
- 모든 성별 대상 조합(M2M’, M2F’, F2M’, F2F’)에서 공격 성공률가 일관되게 높았으며, 공격 스테이지2에서 93.8%에서 98.5%의 범위를 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.