[论文解读] Query-limited Black-box Attacks to Classifiers
本文提出一种基于贝叶斯优化(BO)的黑箱攻击策略,以最小化查询成本生成对抗性样本,针对每次查询均成本高昂的机器学习分类器。通过将攻击建模为约束优化问题,并利用BO智能选择查询点,该方法相较随机搜索将查询次数减少高达90%,尤其在特征修改预算较低时表现更优。
We study black-box attacks on machine learning classifiers where each query to the model incurs some cost or risk of detection to the adversary. We focus explicitly on minimizing the number of queries as a major objective. Specifically, we consider the problem of attacking machine learning classifiers subject to a budget of feature modification cost while minimizing the number of queries, where each query returns only a class and confidence score. We describe an approach that uses Bayesian optimization to minimize the number of queries, and find that the number of queries can be reduced to approximately one tenth of the number needed through a random strategy for scenarios where the feature modification cost budget is low.
研究动机与目标
- 解决在每次模型查询均产生成本或检测风险的黑箱对抗攻击中,最小化查询交互次数的挑战。
- 将攻击生成建模为约束优化问题,以在特征修改成本限制下最小化查询次数。
- 开发一种适用于任意连续分类器(包括神经网络和SVM)的通用攻击策略。
- 在查询效率方面显著优于随机搜索,尤其在严格成本预算下表现更优。
- 使实际场景中的对抗攻击成为可能,例如垃圾邮件过滤等场景,其中发送查询成本高昂或易被检测。
提出的方法
- 将对抗性攻击生成建模为约束优化问题:在满足 f(x) ≠ f(xA) 且 ||x − xA||₁ ≤ C 的条件下,最小化查询次数 Q(x)。
- 应用贝叶斯优化(BO)通过迭代选择利用获取函数确定的有前景查询点,高效搜索对抗性样本。
- 使用高斯过程先验建模未知分类器函数,并在每次查询后更新信念。
- 定义一个获取函数,以平衡探索(高不确定性)与利用(原始类别预测置信度低)。
- 当找到成功的对抗性样本或达到查询上限时终止搜索。
- 通过修改目标函数以最大化预测目标类别的概率,支持无目标和有目标攻击。
实验结果
研究问题
- RQ1贝叶斯优化能否在黑箱设置下显著减少生成对抗性样本所需的查询次数?
- RQ2在特征修改成本预算较低的情况下,所提出的基于BO的攻击相较于随机搜索表现如何?
- RQ3基于BO的方法在不同类型的分类器(如线性SVM、RBF-SVM、人工神经网络)上的查询效率在多大程度上保持一致?
- RQ4当特征修改预算变化时,该方法在查询效率方面的可扩展性如何?
- RQ5该方法能否推广至文本垃圾邮件检测以外的其他黑箱攻击场景?
主要发现
- 与随机搜索相比,基于BO的攻击将平均查询次数减少了高达90%,尤其在特征修改成本预算较低时效果显著。
- 对于成本预算为 C = 10 的人工神经网络分类器,BO方法平均仅需16次查询即可找到首个成功的对抗性样本,而随机搜索则超过400次。
- 在低预算环境下,BO的性能优势最为明显,此时随机搜索往往在查询上限内无法找到对抗性样本。
- 该方法在所有测试分类器(线性SVM、RBF-SVM、ANN)上均实现了稳定的查询减少,展现出良好的泛化能力。
- 对BO查询次数的保守估计(上限为50次)表明,实际性能增益甚至超过报告值,因为该方法通常在达到上限前即已收敛。
- 该方法在无目标和有目标攻击中均有效,且通过简单调整目标函数即可实现对特定类别的攻击。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。