[논문 리뷰] Adversarial Attacks against Neural Networks in Audio Domain: Exploiting Principal Components
이 논문은 흰 상자 및 비흰 상자 환경에서 주성분 분석(PCA)을 사용하여 음성-텍스트 신경망에 대한 대비 공격을 조사한다. 실험 결과, PCA는 DeepSpeech를 100% 성공률로 속일 수 있는 효과적인 대비 음성 샘플을 생성할 수 있음을 입증하였으며, 同시에 PCA가 방어 수단으로서 실패하여 음성 기반 딥러닝 시스템의 취약성을 드러냈다.
Adversarial attacks are inputs that are similar to original inputs but altered on purpose. Speech-to-text neural networks that are widely used today are prone to misclassify adversarial attacks. In this study, first, we investigate the presence of targeted adversarial attacks by altering wave forms from Common Voice data set. We craft adversarial wave forms via Connectionist Temporal Classification Loss Function, and attack DeepSpeech, a speech-to-text neural network implemented by Mozilla. We achieve 100% adversarial success rate (zero successful classification by DeepSpeech) on all 25 adversarial wave forms that we crafted. Second, we investigate the use of PCA as a defense mechanism against adversarial attacks. We reduce dimensionality by applying PCA to these 25 attacks that we created and test them against DeepSpeech. We observe zero successful classification by DeepSpeech, which suggests PCA is not a good defense mechanism in audio domain. Finally, instead of using PCA as a defense mechanism, we use PCA this time to craft adversarial inputs under a black-box setting with minimal adversarial knowledge. With no knowledge regarding the model, parameters, or weights, we craft adversarial attacks by applying PCA to samples from Common Voice data set and achieve 100% adversarial success under black-box setting again when tested against DeepSpeech. We also experiment with different percentage of components necessary to result in a classification during attacking process. In all cases, adversary becomes successful.
연구 동기 및 목표
- PCA를 사용하여 흰 상자 및 비흰 상자 환경에서 음성-텍스트 신경망에 대비 공격를 표적으로 삼는 가능성 여부를 조사한다.
- 음성 영역에서 대비 공격에 대비하여 PCA를 방어 수단으로 평가한다.
- 다양한 성분 유지 수준에서 PCA 기반 복원을 통해 생성된 대비 편향에 대해 DeepSpeech의 강건성(로버스트니)을 평가한다.
- 다양한 복원 정밀도 수준에서 대비 공격의 이동성 및 탐지 가능성에 대해 탐구한다.
제안 방법
- 특정 번역 출력을 향해 DeepSpeech를 표적으로 삼기 위해 연결주의 시간 분류(CTC) 손실 함수를 사용하여 대비 음성 샘플을 생성하였다.
- 대비 웨이브포맷의 차원을 줄이기 위해 PCA를 적용하였으며, 성분 유지 비율(10%에서 95%까지)을 다양하게 설정하여 DeepSpeech에 대한 공격 효과를 테스트하였다.
- 모델 가중치나 아키텍처에 대한 접근 없이도, 정상적인 Common Voice 샘플에 PCA를 적용한 후 편향을 생성함으로써 비흰 상자 대비 공격를 생성하였다.
- 대상 모델로 DeepSpeech를 사용하였으며, 음성 번역을 위한 순환 신경망 기반의 LSTM 아키텍처와 CTC 기반의 시퀀스-투-시퀀스 학습을 활용하였다.
- 번역 실패(정확한 분류가 0개)를 공격 성공 기준으로 삼고, 정규화된 편집 거리와 유사도 지수를 사용하여 청각적 유사도를 평가하였다.
- 다양한 PCA 성분 임계값에서 복원된 음성의 품질과 모델의 잘못 분류 비율을 비교함으로써 대비 공격의 강건성을 평가하였다.
실험 결과
연구 질문
- RQ1모델 지식을 최소로 요구하는 비흰 상자 환경에서 PCA를 효과적으로 사용하여 대비 음성 샘플을 생성할 수 있는가?
- RQ2PCA를 방어 수단으로 적용했을 때 음성-텍스트 시스템에서 대비 공격를 성공적으로 완화할 수 있는가?
- RQ3PCA 성분 유지 수준을 통한 복원 정밀도와 음성 공격의 성공률 사이에 어떤 관계가 있는가?
- RQ4높은 PCA 성분 유지 수준(예: 95%)을 가진 대비 샘플은 원본 음성과 얼마나 청각적으로 유사하며, 인간에 의해 탐지될 수 있는가?
- RQ5특히 DeepSpeech가 벤치마크로 널리 사용되는 점을 고려할 때, PCA 기반으로 생성된 대비 공격는 다양한 음성 모델 간에 얼마나 이동성이 있는가?
주요 결과
- 흰 상자 환경에서 25개의 대비 웨이브포맷을 모두 100% 성공률로 공격하였으며, DeepSpeech는 원본 입력을 인식하지 못하고 대신 표적 문장을 출력하였다.
- 95%의 주파수 성분을 유지한 PCA를 통한 복원 시, 평균 유사도 지수는 87.85%이며, 정규화된 편집 거리는 9로 나타나 원본 음성과 높은 청각적 유사도를 보였다.
- 성분 유지 비율이 10%에 불과한 경우에도 대비 공격는 100% 성공률를 기록하였지만, 평균 유사도 지수는 27.42%로 하락하고 정규화된 편집 거리는 46으로 증가하여 고도로 손상된 상태임을 시사하였다.
- PCA는 방어 수단으로서 효과적이지 않았으며, DeepSpeech는 PCA를 통해 복원된 대비 샘플을 어느 것도 정확히 인식하지 못하였고, 이는 PCA가 대비 편향을 제거하지 못함을 확인하였다.
- 연구 결과, 정상 데이터에 대해 PCA를 적용함으로써 모델 파rameter를 알지 못하는 비흰 상자 환경에서도 100% 성공률로 대비 공격를 성공적으로 생성할 수 있음을 입증하였다.
- 95% 복원 사례는 더 높은 청각적 유사도를 보이며 실제 공격에 더 효과적이므로, 완전한 번역 실패에도 불구하고 대비 샘플을 탐지하기 어려운 상태를 만든다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.