[论文解读] On Collective Robustness of Bagging Against Data Poisoning
本文首次为一般袋装模型在全局数据 poisoning 攻击下提出了集体鲁棒性认证,通过构建一个二值整数线性规划(BILP)问题来计算攻击者可翻转的最大预测数量。提出了一种确定性的基于哈希的子采样方法——哈希袋装(hash bagging),在极低开销下显著提升了原始袋装模型的鲁棒性,在无需架构约束的情况下,跨多个数据集显著提高了认证鲁棒性。
Bootstrap aggregating (bagging) is an effective ensemble protocol, which is believed can enhance robustness by its majority voting mechanism. Recent works further prove the sample-wise robustness certificates for certain forms of bagging (e.g. partition aggregation). Beyond these particular forms, in this paper, \emph{we propose the first collective certification for general bagging to compute the tight robustness against the global poisoning attack}. Specifically, we compute the maximum number of simultaneously changed predictions via solving a binary integer linear programming (BILP) problem. Then we analyze the robustness of vanilla bagging and give the upper bound of the tolerable poison budget. Based on this analysis, \emph{we propose hash bagging} to improve the robustness of vanilla bagging almost for free. This is achieved by modifying the random subsampling in vanilla bagging to a hash-based deterministic subsampling, as a way of controlling the influence scope for each poisoning sample universally. Our extensive experiments show the notable advantage in terms of applicability and robustness.
研究动机与目标
- 为解决一般袋装模型在全局 poisoning 攻击下缺乏正式的集体鲁棒性认证问题。
- 计算比样本级认证更紧致的鲁棒性边界,后者通常会低估集体鲁棒性。
- 通过推导可容忍 poison 预算的上界,分析原始袋装模型鲁棒性的理论极限。
- 提出一种实用、即插即用的防御方法——哈希袋装,无需修改模型架构或超参数即可提升鲁棒性。
- 证明哈希袋装在保持竞争力准确率的同时,实现了更优的认证鲁棒性。
提出的方法
- 通过构建二值整数线性规划(BILP)问题,最大化在给定 poison 预预预算下可同时改变的预测数量,从而实现集体鲁棒性认证。
- 提出一种分解策略,以降低求解 BILP 的计算成本,实现与测试集大小呈线性时间复杂度的计算。
- 基于子训练集和子分类器的预测结果,推导出原始袋装模型可容忍 poison 预算的上界。
- 通过用确定性的、基于哈希的采样替代随机子采样,提出哈希袋装,以限制每个训练样本在各子训练集中的影响范围。
- 利用分解方法,高效计算原始袋装和哈希袋装的集体鲁棒性下界。
- 在四个数据集上进行实证评估,比较不同袋装变体的认证鲁棒性和准确率。
实验结果
研究问题
- RQ1我们能否正式认证一般袋装模型在全局数据 poisoning 攻击下的集体鲁棒性,而非依赖于样本级边界?
- RQ2原始袋装模型在失去鲁棒性之前,可容忍的 poison 预算的理论上限是多少?
- RQ3如何在不改变模型架构或引入显著计算开销的前提下,提升原始袋装模型的鲁棒性?
- RQ4一种确定性的、基于哈希的子采样策略是否能有效限制污染样本的影响范围并增强集体鲁棒性?
- RQ5与现有样本级认证方法相比,所提出的集体认证在紧致性和实用性方面表现如何?
主要发现
- 通过 BILP 提出的集体认证方法所得鲁棒性边界显著优于样本级认证,CIFAR-10 在 50% poison 预算下,攻击预算(M_ATK)最高降低 26.6%。
- 在 CIFAR-10 上,5% poison 预算下,哈希袋装将原始袋装的集体鲁棒性(CR)提升最高达 16.3%,认证准确率(CA)提升最高达 15.2%。
- 在 CIFAR-10 上,50% poison 预算下,与原始袋装相比,哈希袋装使集体鲁棒性的攻击预算(M_ATK)降低 9.67%,认证准确率降低 15.2%。
- 分解策略实现了与测试集大小呈线性时间复杂度的集体鲁棒性下界高效计算,使该方法具备可扩展性。
- 哈希袋装以极低代价实现了更优的鲁棒性——无需额外超参数约束或模型架构限制,具有广泛适用性。
- 在四个数据集上的实证结果表明,哈希袋装在不同 poison 预算下始终能提升认证鲁棒性,同时保持具有竞争力的准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。