[论文解读] Query-Efficient and Scalable Black-Box Adversarial Attacks on Discrete Sequential Data via Bayesian Optimization
本文提出块状贝叶斯攻击(BBA),一种针对离散序列数据的查询高效黑盒对抗攻击方法,利用带有自动相关性确定(ARD)的分类核进行贝叶斯优化,动态识别关键位置。通过采用块分解、历史子采样和后优化策略,BBA在自然语言处理和蛋白质分类任务中均以显著更少的查询次数和更低的修改率实现了最先进(SOTA)的攻击成功率。
We focus on the problem of adversarial attacks against models on discrete sequential data in the black-box setting where the attacker aims to craft adversarial examples with limited query access to the victim model. Existing black-box attacks, mostly based on greedy algorithms, find adversarial examples using pre-computed key positions to perturb, which severely limits the search space and might result in suboptimal solutions. To this end, we propose a query-efficient black-box attack using Bayesian optimization, which dynamically computes important positions using an automatic relevance determination (ARD) categorical kernel. We introduce block decomposition and history subsampling techniques to improve the scalability of Bayesian optimization when an input sequence becomes long. Moreover, we develop a post-optimization algorithm that finds adversarial examples with smaller perturbation size. Experiments on natural language and protein classification tasks demonstrate that our method consistently achieves higher attack success rate with significant reduction in query count and modification rate compared to the previous state-of-the-art methods.
研究动机与目标
- 解决贪婪黑盒攻击在离散序列数据上的局限性,后者会限制搜索空间并导致次优结果。
- 提升在长序列上的黑盒对抗攻击的查询效率与可扩展性,特别是在离散、高维空间中。
- 开发一种方法,利用查询历史和语义相似性动态识别需扰动的关键位置。
- 通过后优化算法减小扰动大小,同时不降低攻击成功率。
- 在包括文本和蛋白质序列在内的多种领域中展示方法的泛化能力。
提出的方法
- 在贝叶斯优化中引入 ARD 分类核,基于查询反馈自动学习输入序列中每个分类变量(如词或氨基酸)的重要性。
- 应用块分解将长序列划分为可管理的块,实现在高维输入空间中的可扩展优化。
- 采用历史子采样策略,在保持优化精度的同时降低高斯过程推理的计算成本。
- 使用基于 DPP 的批量更新策略,选择多样化且信息丰富的序列用于并行评估,提升查询效率。
- 实施后优化算法,对对抗样本进行精炼,以在保持误分类的前提下最小化扰动大小。
- 利用语义相似性定义攻击空间——文本使用 WordNet,蛋白质使用实验可交换性(ExEx),以构建有意义的同义词集合。
实验结果
研究问题
- RQ1在离散序列数据上,带有 ARD 分类核的贝叶斯优化是否能在查询效率和攻击成功率方面优于贪婪方法?
- RQ2块分解与历史子采样在长序列对抗攻击中的可扩展性与性能影响如何?
- RQ3与贪婪批量选择相比,基于 DPP 的批量更新在多大程度上提升了查询效率?
- RQ4后优化能否在不降低攻击成功率的前提下减小扰动大小?
- RQ5所提出方法在不同领域(如自然语言处理与蛋白质序列分类)中的泛化能力如何?
主要发现
- 在 EC50 蛋白质分类任务中,BBA 仅以 2.0% 的修改率和平均 231 次查询实现了 99.8% 的攻击成功率,优于基线方法。
- 在 Yelp 情感分类的 BERT-base 模型上,BBA 实现了 77.4% 的攻击成功率,修改率为 14.0%,平均查询次数为 154 次,显著低于 PWWS 的修改率与查询次数。
- 消融实验表明,基于 DPP 的批量更新相比贪婪批量选择,可将攻击成功率提高并减少最多 15% 的查询次数。
- 在 AG’s News 数据集上,BBA 成功欺骗了 363/500 个样本,修改率为 14.0%,查询次数为 154 次;而 PWWS 仅成功欺骗 267 个样本,修改率为 18.3%,查询次数为 367 次。
- 对于 BERT-large 和 XLNet-large 模型,BBA 在所有指标上均保持优越性能,证实了其在不同模型架构下的鲁棒性。
- 后优化显著减小了成功攻击样本的扰动大小,BBA 在 BERT-base(AG’s News)上的修改率为 14.0%,而 PWWS 在相同子集上的修改率为 18.3%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。