[论文解读] Robust Federated Learning Against Adversarial Attacks for Speech Emotion Recognition
本文提出了一种新颖的联邦对抗性学习框架,用于语音情感识别,结合联邦学习以保障数据隐私,并采用两阶段防御机制——训练阶段的对抗性训练与推理阶段的随机化——以增强模型对白盒对抗性攻击的鲁棒性。该方法在FGSM攻击下实现了90.15%的未加权平均召回率,在更强的迭代式DeepFool攻击下实现了72.32%的未加权平均召回率,显著优于原始联邦学习方法。
Due to the development of machine learning and speech processing, speech emotion recognition has been a popular research topic in recent years. However, the speech data cannot be protected when it is uploaded and processed on servers in the internet-of-things applications of speech emotion recognition. Furthermore, deep neural networks have proven to be vulnerable to human-indistinguishable adversarial perturbations. The adversarial attacks generated from the perturbations may result in deep neural networks wrongly predicting the emotional states. We propose a novel federated adversarial learning framework for protecting both data and deep neural networks. The proposed framework consists of i) federated learning for data privacy, and ii) adversarial training at the training stage and randomisation at the testing stage for model robustness. The experiments show that our proposed framework can effectively protect the speech data locally and improve the model robustness against a series of adversarial attacks.
研究动机与目标
- 通过利用联邦学习将用户语音数据保留在边缘设备上,解决语音情感识别(SER)中的数据隐私问题。
- 在不依赖集中化数据共享的前提下,提升模型对白盒对抗性攻击(尤其是可迁移攻击和迭代攻击)的鲁棒性。
- 评估单阶段防御机制(对抗性训练或随机化)及其组合在联邦学习设置下的有效性。
- 证明在对数梅尔倒谱图上应用随机化对强迭代攻击(如DeepFool)具有显著防御效果。
- 建立一个全面的、保护隐私的端到端流程,以支持真实世界中基于边缘设备的鲁棒语音情感识别应用。
提出的方法
- 采用联邦学习训练全局模型,避免共享原始语音数据,通过将本地数据保留在边缘设备上来保障数据隐私。
- 在模型训练过程中应用对抗性训练,利用FGSM和PGD攻击生成的对抗样本,以提升对单步攻击的鲁棒性。
- 在推理阶段应用随机化,通过以随机比例对对数梅尔倒谱图进行重采样和填充,以扰乱对抗性扰动。
- 采用两阶段防御策略,结合对抗性训练与随机化,以增强对可迁移攻击和迭代攻击的鲁棒性。
- 使用VGG-15架构进行语音情感识别,模型更新通过客户端-服务器联邦学习设置下的FedAvg算法聚合。
- 实验基于EMA数据库进行,采用基于说话人的数据划分方式,以反映真实联邦学习环境下的约束条件。
实验结果
研究问题
- RQ1联邦学习能否在保障语音情感识别中数据隐私的同时,有效支持协作式模型训练?
- RQ2在联邦学习设置下,对抗性训练对防御单步对抗攻击(如FGSM)的效果如何?
- RQ3在推理阶段应用随机化是否能有效提升对更强迭代对抗攻击(如DeepFool)的鲁棒性?
- RQ4在联邦学习中,结合对抗性训练与随机化是否能显著优于单阶段防御机制?
- RQ5当使用不同攻击算法生成对抗样本时,该框架在可迁移攻击下的表现如何,尤其是高可迁移性攻击场景?
主要发现
- 所提出的两阶段防御机制(先对抗性训练,后随机化)在FGSM攻击下的对抗性测试数据上实现了90.15%的未加权平均召回率,优于单阶段防御方法。
- 在更强力的迭代式DeepFool攻击下,联合防御机制实现了72.32%的未加权平均召回率,表明对复杂扰动具有强大鲁棒性。
- 与仅使用对抗性训练相比,随机化在防御迭代攻击方面更为有效,可能是因为此类攻击对特定模型参数存在过拟合特性。
- 对抗性训练对单步攻击(如FGSM)的防御效果优于对迭代攻击(如DeepFool)的防御,表明其泛化能力存在局限。
- 与原始联邦学习相比,该框架显著提升了模型鲁棒性,尤其在高可迁移性和迭代攻击场景下表现突出。
- 实验中采用的说话人依赖型数据划分方式真实反映了联邦学习的实际约束条件,结果表明该框架在这些现实条件下依然有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。