Skip to main content
QUICK REVIEW

[论文解读] Intrinsic Certified Robustness of Bagging against Data Poisoning Attacks

Jinyuan Jia, Xiaoyu Cao|arXiv (Cornell University)|Aug 11, 2020
Adversarial Robustness in Machine Learning被引用 15
一句话总结

本文提出了一种针对数据中毒攻击的袋装法内在认证鲁棒性,通过证明无论使用何种基础学习算法,当中毒训练样本(被修改、删除或插入)的数量低于推导出的阈值时,袋装法对测试样本的预测结果保持一致。该方法在 MNIST 上实现了高达 100 个中毒样本时 91.1% 的认证准确率,优于现有认证防御方法,在鲁棒性和效率方面表现更优。

ABSTRACT

In a \emph{data poisoning attack}, an attacker modifies, deletes, and/or inserts some training examples to corrupt the learnt machine learning model. \emph{Bootstrap Aggregating (bagging)} is a well-known ensemble learning method, which trains multiple base models on random subsamples of a training dataset using a base learning algorithm and uses majority vote to predict labels of testing examples. We prove the intrinsic certified robustness of bagging against data poisoning attacks. Specifically, we show that bagging with an arbitrary base learning algorithm provably predicts the same label for a testing example when the number of modified, deleted, and/or inserted training examples is bounded by a threshold. Moreover, we show that our derived threshold is tight if no assumptions on the base learning algorithm are made. We evaluate our method on MNIST and CIFAR10. For instance, our method achieves a certified accuracy of $91.1\%$ on MNIST when arbitrarily modifying, deleting, and/or inserting 100 training examples. Code is available at: \url{https://github.com/jjy1994/BaggingCertifyDataPoisoning}.

研究动机与目标

  • 为解决现有针对数据中毒攻击的认证防御方法在适用性方面受限或鲁棒性保证过松的问题。
  • 证明袋装法在不依赖基础学习算法假设的前提下,天然具备对数据中毒攻击的认证鲁棒性。
  • 推导出在给定测试输入下,保持标签一致性的中毒训练样本数量的紧致上界。
  • 开发一种基于蒙特卡洛的高效算法,以估计标签概率并计算实际部署中所需的认证中毒规模。
  • 在 MNIST 和 CIFAR10 上对方法进行实证验证,结果表明其在认证准确率和效率方面均优于先前方法。

提出的方法

  • 该方法利用自助聚合(Bootstrap Aggregating,即袋装法),在有放回地随机抽取的训练数据子集上训练多个基础分类器。
  • 对于每个测试样本,集成分类器通过在基础模型中估计的标签概率中选择最高概率的标签进行预测。
  • 认证中毒规模通过涉及集成模型预测的最大和第二大致命标签概率的优化问题求解得出。
  • 基于蒙特卡洛的算法使用 N 个随机采样的子集和 N 个训练好的基础分类器,估计最大标签概率的下界和第二大标签概率的上界。
  • 一种高效算法利用估计的边界求解优化问题,从而为每个测试样本计算出认证中毒规模。
  • 该方法在 MNIST 和 CIFAR10 上进行了评估,相关代码已公开发布,以确保可复现性。

实验结果

研究问题

  • RQ1袋装法能否被形式化证明对修改、删除或插入训练样本的数据中毒攻击具备认证鲁棒性?
  • RQ2在不假设基础学习算法的前提下,所推导的认证中毒规模是否足够紧致?
  • RQ3能否设计一种高效且可扩展的算法,以实际估计计算认证中毒规模所需的标签概率?
  • RQ4在认证鲁棒性和计算效率方面,袋装法的认证鲁棒性与现有认证防御方法相比如何?
  • RQ5在现实的中毒场景下,该方法在 MNIST 和 CIFAR10 等多样化数据集上是否仍能保持强鲁棒性?

主要发现

  • 袋装法对数据中毒攻击具备内在认证鲁棒性,当中毒训练样本数量低于推导出的阈值时,能保持对测试样本预测的一致性。
  • 所推导的认证中毒规模是紧致的,意味着在不假设基础学习算法的前提下,无法保证更大的边界。
  • 在 MNIST 数据集上,当最多 100 个训练样本被任意修改、删除或插入时,该方法实现了 91.1% 的认证准确率。
  • 该方法在认证鲁棒性和计算效率方面均优于现有认证防御方法,尤其在涉及插入和删除的中毒场景中表现更优。
  • 基于蒙特卡洛的估计算法能够高精度地实现对多个测试样本的认证中毒规模的可扩展计算。
  • 该方法具有通用性,适用于任意基础学习算法,因此在现实机器学习系统中具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。