[论文解读] Weighted-Sampling Audio Adversarial Example Attack
本文提出一种基于加权扰动技术(WPT)和采样扰动技术(SPT)的快速、鲁棒音频对抗攻击方法,通过优化扰动音频点的数量和权重,加速生成过程并提升抗噪鲁棒性。该方法仅用4–5分钟即可生成难以察觉、高度鲁棒的对抗样本,显著快于以往方法,同时通过总变差距离(TVD)损失函数提升音频保真度。
Recent studies have highlighted audio adversarial examples as a ubiquitous threat to state-of-the-art automatic speech recognition systems. Thorough studies on how to effectively generate adversarial examples are essential to prevent potential attacks. Despite many research on this, the efficiency and the robustness of existing works are not yet satisfactory. In this paper, we propose~ extit{weighted-sampling audio adversarial examples}, focusing on the numbers and the weights of distortion to reinforce the attack. Further, we apply a denoising method in the loss function to make the adversarial attack more imperceptible. Experiments show that our method is the first in the field to generate audio adversarial examples with low noise and high audio robustness at the minute time-consuming level.
研究动机与目标
- 为解决现有音频对抗攻击方法效率低下问题,这些方法生成单个样本需超过一小时。
- 提升对抗音频样本对常见音频失真(如录音和回放过程中引入的随机噪声)的鲁棒性。
- 探究不同损失函数度量对音频对抗样本质量与难以察觉性的影响。
- 提出一种新概念:优化扰动音频点的数量与权重,而非对所有点进行均匀扰动。
- 通过生成在真实音频退化条件下仍有效的样本,实现实际的空中对抗攻击。
提出的方法
- 提出加权扰动技术(WPT),根据音频信号中各扰动点的重要性自适应分配权重,通过聚焦关键区域提升攻击效率。
- 引入采样扰动技术(SPT),将扰动点数量减少至音频向量的75%,利用语音上下文相关性保持鲁棒性。
- 采用混合损失函数,结合模型损失(用于匹配目标转录)与度量损失(用于保持音频相似性),使用总变差距离(TVD)作为度量以提升难以察觉性。
- 在损失函数中引入去噪机制,以增强对抗点噪声随机干扰的鲁棒性。
- 使用束搜索解码器和学习率衰减策略(β = 0.8)以稳定训练并加速收敛。
- 优化超参数,包括 c = 0.001、γ = 10 和初始学习率为100,每成功生成一次对抗样本后每50次迭代衰减一次。
实验结果
研究问题
- RQ1减少音频对抗样本中扰动点的数量是否能提升其对真实世界音频退化的鲁棒性?
- RQ2为扰动点分配可变权重是否能提升攻击效率并维持高成功率?
- RQ3损失函数中度量选择如何影响音频对抗样本的难以察觉性与鲁棒性?
- RQ4WPT与SPT的结合是否能比最先进方法更快生成对抗样本,同时保持高鲁棒性?
- RQ5能否生成在添加难以察觉的噪声(如录音或传输过程中引入的噪声)后仍有效的音频对抗样本?
主要发现
- 所提方法仅用4–5分钟即可生成音频对抗样本,相比以往方法需超过一小时,实现显著提升。
- 该方法在保持低感知失真的同时实现高攻击成功率,经由所提供网站的听音测试验证。
- SPT将75%的点进行扰动,相比全向量扰动方法,显著提升了对随机噪声的鲁棒性。
- 使用TVD作为度量损失函数,相比标准lp-范数,能生成更难以察觉的对抗样本。
- 该方法与现有攻击方法具有互补性,可应用于增强其他对抗攻击框架的性能。
- 实验表明,对抗样本在添加难以察觉的噪声后仍保持有效性,证明其在真实环境下的强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。