Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Federated Learning Against Adversarial Attacks for Speech Emotion Recognition

Yi Chang, Sofiane Laridi|arXiv (Cornell University)|2022. 03. 09.
Adversarial Robustness in Machine Learning인용 수 13
한 줄 요약

이 논문은 데이터 프라이버시를 확보하기 위해 피어드 학습을 활용하고, 훈련 시 적대적 훈련 및 추론 시 랜덤라이제이션을 통한 이중 단계 방어 전략을 결합한 새로운 피어드 적대적 학습 프레임워크를 제안한다. 이는 화이트박스 적대적 공격에 대한 모델의 강건성을 향상시키는 데 목적이 있으며, FGSM 공격 하에서 90.15%의 무게 조정 평균 재현율을 기록하고, 더 강력한 반복적 DeepFool 공격 하에서는 72.32%를 기록하여 기존의 피어드 학습보다 뚜렷이 뛰어난 성능을 보였다.

ABSTRACT

Due to the development of machine learning and speech processing, speech emotion recognition has been a popular research topic in recent years. However, the speech data cannot be protected when it is uploaded and processed on servers in the internet-of-things applications of speech emotion recognition. Furthermore, deep neural networks have proven to be vulnerable to human-indistinguishable adversarial perturbations. The adversarial attacks generated from the perturbations may result in deep neural networks wrongly predicting the emotional states. We propose a novel federated adversarial learning framework for protecting both data and deep neural networks. The proposed framework consists of i) federated learning for data privacy, and ii) adversarial training at the training stage and randomisation at the testing stage for model robustness. The experiments show that our proposed framework can effectively protect the speech data locally and improve the model robustness against a series of adversarial attacks.

연구 동기 및 목표

  • 사용자 음성 데이터를 엣지 디바이스에 그대로 유지함으로써 음성 정서 인식(SER)에서의 데이터 프라이버시 문제를 해결하기 위해 피어드 학습을 활용한다.
  • 중앙 집중식 데이터 공유에 의존하지 않고도 화이트박스 적대적 공격—특히 이식 가능하고 반복적인 공격—에 대한 모델의 강건성을 향상시키기 위해 노력한다.
  • 단일 단계 방어(적대적 훈련 또는 랜덤라이제이션)와 그 조합이 피어드 학습 환경에서 SER에 대해 얼마나 효과적인지 평가한다.
  • 로그 멜 스펙트로그램에 대한 랜덤라이제이션이 DeepFool과 같은 강력한 반복적 공격에 특히 효과적임을 입증한다.
  • 실제 엣지 기반 응용 프로그램에서 사용 가능한 종합적이고 프라이버시를 보장하는 강건한 SER 파이프라인을 구축한다.

제안 방법

  • 원시 음성 데이터를 공유하지 않고도 전역 모델을 훈련하기 위해 피어드 학습을 활용하여 엣지 디바이스에 국한된 로컬 데이터를 유지함으로써 데이터 프라이버시를 확보한다.
  • 단일 단계 공격에 대한 강건성을 향상시키기 위해 FGSM 및 PGD 공격를 통해 생성된 적대적 예제를 사용하여 훈련 중에 적대적 훈련을 적용한다.
  • 추론 시점에 로그 멜 스펙트로그램을 무작위 비율로 크기 조정하고 패딩하여 적대적 편향을 방해한다.
  • 이중 단계 방어 전략으로서 적대적 훈련과 랜덤라이제이션을 조합하여 이식 가능하고 반복적인 공격에 대한 강건성을 향상시킨다.
  • SER에 대해 VGG-15 아키텍처를 사용하고, 클라이언트-서버 피어드 학습 환경에서 FedAvg를 통해 모델 업데이트를 집계한다.
  • 실험은 실제 피어드 학습 환경의 제약 조건을 반영하기 위해 스피커 기반 데이터 분할 방식을 사용한 EMA 데이터베이스에서 수행된다.

실험 결과

연구 질문

  • RQ1피어드 학습을 통해 음성 정서 인식에서 데이터 프라이버시를 효과적으로 보존하면서도 공동 모델 훈련을 가능하게 할 수 있는가?
  • RQ2피어드 학습 환경에서 단일 단계 적대적 훈련이 FGSM과 같은 단일 단계 적대적 공격에 대해 얼마나 효과적인가?
  • RQ3추론 시점에 적용된 랜덤라이제이션이 DeepFool과 같은 더 강력한 반복적 적대적 공격에 대해 강건성을 향상시킬 수 있는가?
  • RQ4적대적 훈련과 랜덤라이제이션을 조합하면 단일 단계 방어 전략보다 유의미하게 더 높은 강건성을 달성할 수 있는가?
  • RQ5특히 다양한 공격 알고리즘을 사용해 생성된 적대적 예제가 적용되었을 때, 제안된 프레임워크는 이식 가능 공격에 대해 어떻게 성능을 보이는가?

주요 결과

  • 적대적 훈련 후 랜덤라이제이션을 적용하는 이중 단계 방어 전략이 FGSM 공격 하에서 90.15%의 무게 조정 평균 재현율을 기록하여 단일 단계 방어 전략을 능가했다.
  • 더 강력한 반복적 DeepFool 공격 하에서는 조합된 방어 전략이 72.32%의 무게 조정 평균 재현율을 기록하여 복잡한 편향에 대한 강건성을 입증했다.
  • 반복적 공격에 대비하여 랜덤라이제이션이 적대적 훈련만으로는 더 효과적이었으며, 이는 이러한 공격가 특정 모델 파rameter에 과적합되기 때문일 것이다.
  • 적대적 훈련은 FGSM과 같은 단일 단계 공격에 대해 DeepFool과 같은 반복적 공격보다 더 나은 방어 효과를 보였으며, 일반화 능력에 한계가 있음을 시사한다.
  • 특히 고이식 가능성과 반복적 공격 시나리오에서 기존의 피어드 학습보다 모델의 강건성이 뚜렷이 향상되었다.
  • 실험에서 사용된 스피커 기반 데이터 분할 방식은 실제 피어드 학습 환경의 제약 조건을 반영하며, 결과적으로 이러한 현실적인 조건에서도 프레임워크가 효과성을 유지함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.