[论文解读] Improving Adversarial Robustness via Unlabeled Out-of-Domain Data
本文提出利用易于收集的无标签域外数据(如网络搜索获取的图像)显著提升图像分类中的对抗鲁棒性。通过证明此类数据可在标准学习与鲁棒学习之间弥合样本复杂度差距,特别是在领域共享稀疏性等结构特征时,该方法在CIFAR-10、CINIC-10和SVHN上实现了最先进的鲁棒准确率,且仅需极少的标注数据,无需分布对齐。
Data augmentation by incorporating cheap unlabeled data from multiple domains is a powerful way to improve prediction especially when there is limited labeled data. In this work, we investigate how adversarial robustness can be enhanced by leveraging out-of-domain unlabeled data. We demonstrate that for broad classes of distributions and classifiers, there exists a sample complexity gap between standard and robust classification. We quantify to what degree this gap can be bridged via leveraging unlabeled samples from a shifted domain by providing both upper and lower bounds. Moreover, we show settings where we achieve better adversarial robustness when the unlabeled data come from a shifted domain rather than the same domain as the labeled data. We also investigate how to leverage out-of-domain data when some structural information, such as sparsity, is shared between labeled and unlabeled domains. Experimentally, we augment two object recognition datasets (CIFAR-10 and SVHN) with easy to obtain and unlabeled out-of-domain data and demonstrate substantial improvement in the model's robustness against $\ell_\infty$ adversarial attacks on the original domain.
研究动机与目标
- 解决对抗鲁棒性中标签数据有限的问题,即标准训练所需样本量远超鲁棒训练。
- 探究来自分布偏移(域外)的无标签数据是否能提升鲁棒性,尤其在域内数据难以获取时。
- 量化域外数据在增强鲁棒性方面优于域内数据的条件,特别是在共享结构特性(如稀疏性)时。
- 证明利用域外数据的半监督学习可弥合标准分类与鲁棒分类之间的样本复杂度差距。
- 提供理论边界与实证验证,表明廉价、噪声大、域外的数据(如网络搜索获取)可带来显著的鲁棒性提升。
提出的方法
- 提出一种灵活的生成模型,采用高斯分布特征与非线性分类器,以在分布偏移下建模标准与鲁棒分类。
- 建立标准学习与鲁棒学习之间样本复杂度差距的理论边界,表明该差距在一般分布下依然存在。
- 引入极小化-极大化下界,证明样本复杂度差距的必要性,强化鲁棒学习的理论挑战。
- 设计一种半监督学习框架,通过将标注数据投影到共享结构支撑(如稀疏特征)上来利用无标签域外数据,降低有效维度。
- 在真实世界数据集上应用该方法,采用Wide ResNet架构进行标准训练与对抗训练,结合数据增强与PGD攻击进行评估。
- 通过Bing图像搜索与网络爬取构建大规模、低质量的域外数据集(Cheap-10),随后进行尺寸调整并用于CIFAR-10与CINIC-10的数据增强。
实验结果
研究问题
- RQ1无标签域外数据能否减少标准与鲁棒分类之间的样本复杂度差距?
- RQ2在何种条件下,使用域外数据能带来比使用域内无标签数据更好的对抗鲁棒性?
- RQ3领域间共享的结构信息(如稀疏性)如何影响域外数据在提升鲁棒性方面的有效性?
- RQ4与干净的域内数据相比,噪声大、质量低、易于获取的域外数据能在多大程度上提升鲁棒性?
- RQ5在半监督对抗训练中,数据质量、分布偏移与鲁棒准确率之间的理论与实证权衡是什么?
主要发现
- 域外无标签数据可显著提升对抗鲁棒性,当使用Cheap-10数据增强时,CIFAR-10上的鲁棒准确率显著提高。
- 在某些设置下,域外数据带来的鲁棒准确率优于域内无标签数据,尤其当领域共享结构特征(如稀疏性)时。
- 理论分析证实,标准学习与鲁棒学习之间存在持续的样本复杂度差距,而该差距可通过无标签域外数据得以弥合。
- 当领域间存在共享稀疏性结构时,即使稀疏性未知,也能有效利用,从而在无需先验知识的情况下提升鲁棒性。
- 在CIFAR-10与CINIC-10上的实证结果表明,添加Cheap-10(500k张图像)后,鲁棒准确率高于仅使用原始数据集的情况。
- 在SVHN上,域外数据带来的鲁棒性增益取决于噪声水平,存在数据质量与性能提升之间的清晰权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。