Skip to main content
QUICK REVIEW

[논문 리뷰] Investigating Robustness of Adversarial Samples Detection for Automatic Speaker Verification

Xu Li, Na Li|arXiv (Cornell University)|2020. 06. 11.
Adversarial Robustness in Machine Learning참고 문헌 32인용 수 12
한 줄 요약

이 논문은 주요 ASV 시스템을 재학습하지 않고도 자동 음성 인식(ASV)에서 악성 표본을 식별하기 위해 별도의 VGG 유사 검출망을 제안한다. 이 검출기는 볼 수 있는 공격에 대해 뛰어난 성능을 보이며(EER$_{\text{det}}$ < 0.55%), 그러나 예측되지 않은 변형 방법에 대해서는 약한 내성성을 보이며(최대 50.37%의 EER$_{\text{det}}$ 증가), 향후 대응 조치 개발을 위한 핵심적인 취약점을 드러낸다.

ABSTRACT

Recently adversarial attacks on automatic speaker verification (ASV) systems attracted widespread attention as they pose severe threats to ASV systems. However, methods to defend against such attacks are limited. Existing approaches mainly focus on retraining ASV systems with adversarial data augmentation. Also, countermeasure robustness against different attack settings are insufficiently investigated. Orthogonal to prior approaches, this work proposes to defend ASV systems against adversarial attacks with a separate detection network, rather than augmenting adversarial data into ASV training. A VGG-like binary classification detector is introduced and demonstrated to be effective on detecting adversarial samples. To investigate detector robustness in a realistic defense scenario where unseen attack settings may exist, we analyze various kinds of unseen attack settings' impact and observe that the detector is robust (6.27\% EER_{det} degradation in the worst case) against unseen substitute ASV systems, but it has weak robustness (50.37\% EER_{det} degradation in the worst case) against unseen perturbation methods. The weak robustness against unseen perturbation methods shows a direction for developing stronger countermeasures.

연구 동기 및 목표

  • 주요 ASV 모델을 재학습하지 않고도 자동 음성 인식(ASV) 시스템에 대한 악성 공격에 대비한 방어 기법을 개발하는 것.
  • 학습 중에 공격 설정(예: 대체 ASV 시스템, 변형 방법 등)이 알려지지 않은 현실적인 상황에서 검출기의 내성성을 조사하는 것.
  • 특히 예측되지 않은 변형 방법에 대한 내성성 부족을 포함한 현재 검출 접근법의 취약점을 규명하는 것.
  • 기존의 위조 탐지 파이프라인에 악성 표본 검출을 통합하여 통합된 위조 방지 대응 조치의 기반을 마련하는 것.

제안 방법

  • 진짜와 악성 음성 표본을 음향 특징 기반으로 구분하는 VGG 유사 이진 분류 네트워크를 학습한다.
  • 악성 표본은 기본 반복 방법(BIM)과 잭비안 기반 중요도 지ap 공격(JSMA)이라는 두 가지 주요 방법을 사용해 생성하며, 변형 강도를 다양하게 설정한다.
  • 검출기는 세 가지 대표적인 ASV 프레임워크에서 생성된 악성 표본을 기반으로 학습한다: i-vector(GMM), x-vector(TDNN), r-vector(ResNet-34).
  • 검출기 성능은 도메인 내 및 도메인 외 공격 설정에서 검출 정확도(DA)와 등가 오류율(EER$_{\text{det}}$)을 사용해 평가된다.
  • 내성성은 예측되지 않은 대체 ASV 시스템과 예측되지 않은 변형 방법에 대해 테스트하며, 분석을 위해 악성 표본 점수 분포를 시각화한다.
  • 다양한 변형 패턴에 대한 일반화 능력을 평가하기 위해 BIM과 JSMA 표본의 조합을 사용해 검출기를 학습한다.

실험 결과

연구 질문

  • RQ1주요 ASV 모델을 재학습하지 않고도 독립적인 검출 네트워크가 ASV 시스템 내 악성 표본을 효과적으로 식별할 수 있는가?
  • RQ2악성 표본을 생성하는 데 사용된 예측되지 않은 대체 ASV 시스템에 대해 검출기가 얼마나 내성적인가?
  • RQ3BIM과 JSMA와 같은 예측되지 않은 변형 방법에 직면했을 때 검출기 성능은 어떻게 저하되는가?
  • RQ4다양한 변형 방법 간에 검출기의 일반화 능력은 대칭적인가?
  • RQ5학습 시 여러 변형 방법을 결합하면 예측되지 않은 공격 패tern에 대한 내성성이 향상되는가?

주요 결과

  • BIM과 JSMA로 생성된 도메인 내 악성 표본에 대해 검출기는 높은 검출 정확도(99% 이상)와 낮은 EER$_{\text{det}}$(0.18%에서 0.55% 사이)를 달성한다.
  • 검출기는 예측되지 않은 대체 ASV 시스템에 대해 강력한 내성성을 보이며, r-vector에서 학습하고 i-vector에서 평가했을 때 최악의 경우 EER$_{\text{det}}$ 증가율이 단지 6.27%에 그친다.
  • 반면, 예측되지 않은 변형 방법에 대해서는 상당히 낮은 내성성을 보이며, BIM에서 JSMA로의 전이 시 EER$_{\text{det}}$ 증가율이 최대 50.37%에 이른다.
  • 일반화 능력은 비대칭적이다: JSMA에서 BIM으로의 전이는 단지 10.15%의 EER$_{\text{det}}$ 증가를 보이지만, BIM에서 JSMA로의 전이는 50.55%의 EER$_{\text{det}}$ 증가를 보이며, 일부 예측되지 않은 방법에 대한 높은 취약성을 시사한다.
  • BIM과 JSMA 방법을 병행해 학습함으로써 일반화 능력이 향상되며, 예측되지 않은 방법에 대해 0.92%의 EER$_{\text{det}}$를 기록함으로써 다양한 학습 데이터가 내성성을 향상시킨다는 것을 시사한다.
  • 악성 표본 점수 분포의 시각화 결과, 성능 저하가 발생하더라도 다양한 ASV 시스템에서 악성 표본에 대해 높은 점수를 효과적으로 부여할 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.