Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond $L_p$ clipping: Equalization-based Psychoacoustic Attacks against ASRs

Hadi Abdullah, Muhammad Sajidur Rahman|arXiv (Cornell University)|2021. 10. 25.
Speech Recognition and Synthesis참고 문헌 40인용 수 6
한 줄 요약

이 논문은 인간 청각 막힘 현상을 활용하여 기존의 전통적 및 엔드 투 엔드(End-to-End) 음성 인식(ASR) 시스템 모두에 대해 인식 불가능한 대비 음성(adversarial audio)을 생성하는 등가화 기반 심리음향 공격을 제안한다. 심리음향 막힘 임계치를 이용해 변형을 제약함으로써, 이 방법은 DeepSpeech에 대해 100%의 성공률, Wav2Letter에 대해 76%의 성공률를 기록하였으며, 사용자 연구를 통해 최신의 $L_p$ 기반 공격보다 훨씬 낮은 청취 가능 왜곡을 확인하였다.

ABSTRACT

Automatic Speech Recognition (ASR) systems convert speech into text and can be placed into two broad categories: traditional and fully end-to-end. Both types have been shown to be vulnerable to adversarial audio examples that sound benign to the human ear but force the ASR to produce malicious transcriptions. Of these attacks, only the "psychoacoustic" attacks can create examples with relatively imperceptible perturbations, as they leverage the knowledge of the human auditory system. Unfortunately, existing psychoacoustic attacks can only be applied against traditional models, and are obsolete against the newer, fully end-to-end ASRs. In this paper, we propose an equalization-based psychoacoustic attack that can exploit both traditional and fully end-to-end ASRs. We successfully demonstrate our attack against real-world ASRs that include DeepSpeech and Wav2Letter. Moreover, we employ a user study to verify that our method creates low audible distortion. Specifically, 80 of the 100 participants voted in favor of all our attack audio samples as less noisier than the existing state-of-the-art attack. Through this, we demonstrate both types of existing ASR pipelines can be exploited with minimum degradation to attack audio quality.

연구 동기 및 목표

  • 신호 처리 기반 특징 추출을 사용하는 전통적 ASR에만 작용하는 기존 심리음향 공격의 한계를 해결하기 위해.
  • 전통적 및 완전히 엔드 투 엔드 ASR 아키텍처 양쪽에 효과적인 통합된 공격 방법을 개발하기 위해.
  • $L_p$ 클리핑을 심리음향적으로 정보화된 변형 제약으로 대체함으로써 대비 음성의 음질을 향상시키기 위해.
  • 사용자 연구를 통해 대비 음성의 지각적 품질을 검증하고, 최신의 CW 공격과 비교하기 위해.
  • 적절한 지각 모델링이 적용될 경우 현대적인 엔드 투 엔드 ASR도 여전히 심리음향 공격에 취약함을 보여주기 위해.

제안 방법

  • 공격는 주파수 도메인의 막힘 임계치를 계산하기 위해 심리음향 모델을 사용하며, 이는 대비 변형의 크기를 제약하는 데 사용된다.
  • 변형은 STFT를 통해 시간-주파수 도메인에서 생성되며, 에너지가 막힘 임계치 이하로 유지되도록 등가화가 적용된다.
  • 공격는 시간 도메인과 주파수 도메인을 번갈아 사용하며, 변형 후 신호를 복원하기 위해 Griffin-Lim을 활용한다.
  • 변형 에너지를 최소화하면서도 높은 ASR 공격 성공률를 유지하기 위해 반복 최적화를 사용한다.
  • 동일한 프레임워크를 사용하여 전통적 ASR(예: DeepSpeech)와 엔드 투 엔드 모델(예: Wav2Letter) 양쪽에 공격를 적용한다.
  • $L_p$ 클리핑 방법은 인간 청각 막힘 현상을 고려하지 않기 때문에 청취 품질 제어에 부적절하다는 것이 입증되었다.

실험 결과

연구 질문

  • RQ1전통적 및 완전히 엔드 투 엔드 ASR 시스템 양쪽에 효과적인 심리음향 공격를 설계할 수 있는가?
  • RQ2막힘 임계치 사용과 $L_p$ 클리핑 간의 청취 가능한 음질 측면에서의 비교는 어떠한가?
  • RQ3등가화 기반 변형은 인간 청취자에게 얼마나 인식 불가능하게 유지되는가?
  • RQ4공격는 현대적인 엔드 투 엔드 ASR에서 높은 성공률를 유지하면서 청취 가능 왜곡을 최소화하는가?
  • RQ5신호 처리와 심리음향을 모두 활용하여 고품질의 대비 음성을 생성할 수 있는 통합 공격 프레임워크를 개발할 수 있는가?

주요 결과

  • 제안된 등가화 기반 공격는 전통적 DeepSpeech ASR 모델에 대해 100%의 성공률를 기록하였다.
  • 완전히 엔드 투 엔드 Wav2Letter 모델에 대해서는 76%의 성공률를 기록하였으며, 최신의 최적화 기반 공격와 유사한 성능을 보였다.
  • 100명의 참가자가 참여한 사용자 연구에서, 80%의 참가자가 이 방법으로 생성된 모든 대비 음성 샘플을 CW 공격의 음성보다 덜 거친 것으로 평가하였다.
  • 70% 이상의 참가자가 CW 공격의 음성 샘플을 짜증나게 느꼈다(약간, 매우 짜증나거나 매우 짜증남), 반면 제안된 방법의 샘플은 2–32%만이 구별 가능하다고 느꼈지만 짜증나지 않았다.
  • $\chi^2$ 검정을 통해 음질에 통계적으로 유의미한 차이가 있음을 확인하였으며(p < 0.01), 제안된 방법이 훨씬 낮은 청취 가능 왜곡을 유발한다는 것이 검증되었다.
  • 연구 결과, $L_p$ 클리핑는 인간 청각 막힘 현상을 고려하지 않기 때문에 청취 품질 제어에 부적절한 방법임을 밝혀냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.