Skip to main content
QUICK REVIEW

[论文解读] Exploiting the Potential of Datasets: A Data-Centric Approach for Model Robustness

Yiqi Zhong, Lei Wu|arXiv (Cornell University)|Mar 10, 2022
Adversarial Robustness in Machine Learning被引用 8
一句话总结

本文提出一种以数据为中心的方法,通过在不增加样本数量的前提下,向训练数据集注入可迁移的对抗样本和14种常见噪声,以提升深度神经网络的鲁棒性。该方法显著提升了模型在对抗样本和噪声输入下的性能,在一项大型竞赛中分别获得第三名和第四名,且在扰动数据上的准确率提升超过20%。

ABSTRACT

Robustness of deep neural networks (DNNs) to malicious perturbations is a hot topic in trustworthy AI. Existing techniques obtain robust models given fixed datasets, either by modifying model structures, or by optimizing the process of inference or training. While significant improvements have been made, the possibility of constructing a high-quality dataset for model robustness remain unexplored. Follow the campaign of data-centric AI launched by Andrew Ng, we propose a novel algorithm for dataset enhancement that works well for many existing DNN models to improve robustness. Transferable adversarial examples and 14 kinds of common corruptions are included in our optimized dataset. In the data-centric robust learning competition hosted by Alibaba Group and Tsinghua University, our algorithm came third out of more than 3000 competitors in the first stage while we ranked fourth in the second stage. Our code is available at \url{https://github.com/hncszyq/tianchi_challenge}.

研究动机与目标

  • 探索数据集工程在可信人工智能中提升模型鲁棒性方面的未被发掘潜力。
  • 解决现有研究仅关注模型中心防御而忽视数据质量的空白。
  • 开发一种系统性的、以数据为中心的方法,提升模型对对抗样本和常见噪声的鲁棒性。
  • 证明在不增加样本数量的前提下,通过优化数据集可显著提升模型鲁棒性。
  • 在面对数千名参赛者的实际竞赛环境中验证该方法的有效性。

提出的方法

  • 通过在部分原始干净样本上添加对抗扰动和常见噪声,增强原始训练数据集。
  • 使用300次PGD迭代生成可迁移的对抗样本,$\epsilon=8$,$\alpha=2/255$,用于$l_\infty$-有界扰动。
  • 对选定样本应用14种常见噪声(如雨天、下雪、噪声等),以模拟真实世界中的分布偏移。
  • 调整比例参数$\alpha$以平衡干净样本、对抗样本和噪声样本的分布;$\alpha = 0:1:4$取得最优结果。
  • 保持原始数据集规模(50,000个样本),确保训练数据量不增加。
  • 使用ResNet50、WideResNet、DenseNet121、VGG16和MobileNetV2的模型集成,生成可迁移的对抗样本。

实验结果

研究问题

  • RQ1在不增加样本数量的前提下,通过数据集增强是否能显著提升深度神经网络对对抗样本和噪声输入的鲁棒性?
  • RQ2训练集中干净样本、对抗样本和噪声样本的分布如何影响模型在联合扰动下的泛化能力?
  • RQ3在真实世界基准设置中,以数据为中心的方法是否能与最先进的模型中心鲁棒性技术相媲美?
  • RQ4当可迁移的对抗样本和多样化的噪声被注入固定数据集时,其对鲁棒性的提升程度如何?
  • RQ5在联合威胁场景下,一种简单且可扩展的数据增强策略是否能超越复杂的模型架构在鲁棒性上的表现?

主要发现

  • 所提出的以数据为中心的方法在阿里巴巴-清华以数据为中心鲁棒学习竞赛的第一轮中取得3,691名参赛者中的第三名。
  • 在第二轮中,该方法在50名参赛者中位列第四,表明其在不同模型架构下均具备出色的泛化能力。
  • 在优化后的数据集上训练的模型,其在对抗样本和噪声样本上的鲁棒性得分相比基线提升超过20%。
  • 模型在对抗子数据集和噪声子数据集上的分类准确率均提升超过20个百分点,证实了该方法的有效性。
  • 最优的样本比例$\alpha = 0:1:4$(训练集中无干净样本)优于平衡配置或以干净样本为主的配置,表明扰动数据携带了有用的分布信息。
  • 该方法在不增加数据集规模的前提下实现了显著的鲁棒性提升,证明了可通过工程化数据质量来增强模型可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。