Skip to main content
QUICK REVIEW

[论文解读] Preprocessors Matter! Realistic Decision-Based Attacks on Machine Learning Systems

Chawin Sitawarin, Florian Tramèr|arXiv (Cornell University)|Oct 7, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文表明,标准的基于决策的黑箱攻击在真实机器学习流水线中常见的预处理器面前严重受阻,导致扰动范数最高上升7倍。为克服此问题,作者提出一种两阶段攻击:首先通过数百次查询提取预处理器,然后实施预处理器感知攻击,从而恢复攻击的全部有效性,性能与独立模型上的攻击相当。

ABSTRACT

Decision-based attacks construct adversarial examples against a machine learning (ML) model by making only hard-label queries. These attacks have mainly been applied directly to standalone neural networks. However, in practice, ML models are just one component of a larger learning system. We find that by adding a single preprocessor in front of a classifier, state-of-the-art query-based attacks are up to 7$ imes$ less effective at attacking a prediction pipeline than at attacking the model alone. We explain this discrepancy by the fact that most preprocessors introduce some notion of invariance to the input space. Hence, attacks that are unaware of this invariance inevitably waste a large number of queries to re-discover or overcome it. We, therefore, develop techniques to (i) reverse-engineer the preprocessor and then (ii) use this extracted information to attack the end-to-end system. Our preprocessors extraction method requires only a few hundred queries, and our preprocessor-aware attacks recover the same efficacy as when attacking the model alone. The code can be found at https://github.com/google-research/preprocessor-aware-black-box-attack.

研究动机与目标

  • 研究预处理器对真实世界机器学习系统中基于决策的黑箱攻击有效性的影响。
  • 揭示标准攻击在包含预处理组件的端到端系统中失效的原因。
  • 开发一种仅使用数百次查询即可高效提取未知预处理器的方法。
  • 设计针对预处理器感知的攻击,以在未知预处理器的系统上恢复完整的攻击效能。
  • 证明预处理器提取比超参数调优对成功攻击更为关键。

提出的方法

  • 通过查询系统并分析多样化输入下的输入-输出行为,逆向推导预处理器。
  • 采用适用于黑箱决策查询的模型提取技术(Tramèr et al., 2016),推断预处理器功能。
  • 构建一个模仿目标系统输入变换行为的代理预处理器。
  • 修改基于决策的攻击(如HSJA、QEBA),使其在预处理后的输入空间中运行,避免重复查询以重新发现不变性。
  • 应用偏差梯度策略,引导搜索生成对预处理器变换具有鲁棒性的对抗样本。
  • 通过在多个对抗样本间分摊预处理器提取的成本,提升效率。

实验结果

研究问题

  • RQ1常见的预处理器(如缩放、量化、JPEG压缩)如何影响基于决策的黑箱攻击的成功率?
  • RQ2为何标准的基于决策的攻击在应用到带有预处理器的端到端系统时,无法实现低扰动范数?
  • RQ3能否仅用少量查询逆向工程黑箱系统中的预处理器?
  • RQ4预处理器感知攻击是否能恢复与在独立模型上攻击相当的性能?
  • RQ5与超参数调优相比,预处理器提取是否更有效地提升攻击成功率?

主要发现

  • 与独立模型相比,标准基于决策的攻击在带有预处理器的系统上,其平均ℓ₂失真度提高了7倍。
  • 即使经过大量超参数调优和增加查询预算,未感知预处理器的攻击仍无法弥合性能差距。
  • 所提出的预处理器提取方法仅需数百次查询,即可准确逆向工程常见预处理器(如缩放和JPEG压缩)。
  • 预处理器感知攻击实现的对抗扰动范数与在独立模型上的结果无法区分,有效恢复了完整的攻击效能。
  • 偏差梯度攻击在所有未感知攻击中表现最优,在最佳情况下(JPEG质量60,非目标HSJA)将平均失真度降低了最多15倍。
  • 即使在500次查询时,预处理器感知攻击在所有查询预算下均保持一致的性能提升,失真度降低4.5至4.8倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。