Skip to main content
QUICK REVIEW

[논문 리뷰] Defending against Adversarial Audio via Diffusion Model

Shutong Wu, Jiongxiao Wang|arXiv (Cornell University)|2023. 03. 02.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 사전 훈련된 웨이브포맷 기반 확산 모델을 활용하여 악성 음성 입력을 노이즈를 첨가하고 역방향 샘플링 과정을 통해 깨끗한 음성을 복원함으로써, 적대적 음성에 대한 즉각적 적용이 가능한 AudioPure라는 방식을 제안한다. 이는 다양한 $β$-노름 기반 적대적 공격에 대해 기존 기준보다 최대 20% 높은 강건한 정확도를 달성하며, 랜덤화된 스무딩을 통한 우수한 인증된 강건성도 입증한다.

ABSTRACT

Deep learning models have been widely used in commercial acoustic systems in recent years. However, adversarial audio examples can cause abnormal behaviors for those acoustic systems, while being hard for humans to perceive. Various methods, such as transformation-based defenses and adversarial training, have been proposed to protect acoustic systems from adversarial attacks, but they are less effective against adaptive attacks. Furthermore, directly applying the methods from the image domain can lead to suboptimal results because of the unique properties of audio data. In this paper, we propose an adversarial purification-based defense pipeline, AudioPure, for acoustic systems via off-the-shelf diffusion models. Taking advantage of the strong generation ability of diffusion models, AudioPure first adds a small amount of noise to the adversarial audio and then runs the reverse sampling step to purify the noisy audio and recover clean audio. AudioPure is a plug-and-play method that can be directly applied to any pretrained classifier without any fine-tuning or re-training. We conduct extensive experiments on speech command recognition task to evaluate the robustness of AudioPure. Our method is effective against diverse adversarial attacks (e.g. $\mathcal{L}_2$ or $\mathcal{L}_\infty$-norm). It outperforms the existing methods under both strong adaptive white-box and black-box attacks bounded by $\mathcal{L}_2$ or $\mathcal{L}_\infty$-norm (up to +20\% in robust accuracy). Besides, we also evaluate the certified robustness for perturbations bounded by $\mathcal{L}_2$-norm via randomized smoothing. Our pipeline achieves a higher certified accuracy than baselines.

연구 동기 및 목표

  • 딥 러닝 기반 음성 시스템의 미세한 적대적 음성 변형에 대한 취약성을 해결하기 위해.
  • 적대적 재훈련이나 모델의 피팅 조정 없이도 다양한 적대적 공격에 일반화되는 방식을 개발하기 위해.
  • 이미지 분야에서 성공한 확산 모델을 음성 정제에 적용함으로써, 길이가 변동 가능한 입력과 표현 민감도 등의 도메인 특수 과제를 해결하기 위해.
  • 강력한 적응형, 블랙박스, EOT 공격 하에서의 강건성 평가와 함께, 랜덤화된 스무딩을 통한 인증된 강건성 확립을 위해.

제안 방법

  • AudioPure는 사전 훈련된 웨이브포맷 기반 확산 모델을 사용하여, 먼저 노이즈를 첨가한 후 단순화된 역방향 샘플링 과정을 적용해 깨끗한 음성을 복원함으로써 적대적 음성 입력을 정제한다.
  • 이 방법은 재훈련이나 피팅 조정이 필요 없는 즉각적 적용이 가능한 파이프라인으로 작동한다.
  • 확산 모델의 강력한 생성 능력을 활용해 적대적 변형을 억제하면서도 의미적 콘텐츠는 유지한다.
  • 이 방식은 $β$-노름 및 $∞$-노름 기반 공격, 특히 적응형 및 블랙박스 변형에 대해 음성 명령 인식 시스템을 대상으로 평가된다.
  • 랜덤화된 스무딩을 사용해 인증된 강건성을 평가하며, 노이즈 수준 $σ = \{0.5, 1.0\}$을 적용하고 효율성을 위해 한 번의 정제를 수행한다.
  • AudioPure는 적대적 훈련, 변환 기반 방어, 스펙트로그램 표현 기반의 확산 모델을 포함한 기준 모델들과 비교된다.

실험 결과

연구 질문

  • RQ1사전 훈련된 확산 모델을 분류기 재훈련 없이도 적대적 음성에 대응하기 위해 효과적으로 적용할 수 있는가?
  • RQ2웨이브포맷 기반 확산 모델과 스펙트로그램 기반 확산 모델 간의 강건성 및 깨끗한 정확도 측면에서의 성능 비교는 어떻게 되는가?
  • RQ3강력한 적응형 및 블랙박스 공격 하에서 AudioPure는 기존 방어 기법보다 더 높은 강건한 정확도를 달성하는가?
  • RQ4랜덤화된 스무딩을 통해 평가했을 때 AudioPure는 기준 모델보다 더 높은 인증된 강건성을 확보하는가?
  • RQ5웨이브포맷 대비 스펙트로그램 표현 방식이 확산 기반 정제 성능에 어떤 영향을 미치는가?

주요 결과

  • AudioPure는 $β$-노름 및 $∞$-노름 기반의 적대적 공격, 특히 강력한 적응형 및 블랙박스 공격 하에서도 기존 기법 대비 최대 20% 높은 강건한 정확도를 달성한다.
  • 웨이브포맷 기반 확산 모델(DiffWave)은 스펙트로그램 기반 모델(DiffSpec)보다 $β$-노름 공격 하에서 강건한 정확도가 35% 높지만, DiffSpec는 더 높은 깨끗한 정확도를 기록한다.
  • 모든 테스트 노이즈 수준에서 RS-Vanilla 및 RS-Gaussian 기준 모델보다 높은 인증된 강건한 정확도를 확보했으며, $σ = 0.5$일 때 반경 1.50에서 13%의 인증 정확도를 기록했다.
  • 큰 변형이 가해져도 성능 저하가 느리게 발생하여, 기준 모델 대비 편차가 더 느리게 증가함을 확인했다.
  • 추가 분석 결과, 이미지 기반 확산 모델을 그대로 스펙트로그램에 적용할 경우 정보 압축과 고정된 입력 크기 제약으로 인해 최적의 성능을 내지 못함을 확인했다.
  • AudioPure는 다양한 분류기 아키텍처에 대해 모델 피팅 조정 없이도 일반적으로 적용 가능한 즉각적 적용 방식임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.