Skip to main content
QUICK REVIEW

[论文解读] Efficient Adversarial Contrastive Learning via Robustness-Aware Coreset Selection

Xilie Xu, Jingfeng Zhang|arXiv (Cornell University)|Feb 8, 2023
Domain Adaptation and Few-Shot Learning被引用 7
一句话总结

本文提出鲁棒性感知核心集选择(RCS),一种无标签方法,通过选择一小部分信息量丰富的数据子集,最小化自然样本与虚拟对抗样本之间的表征差异,从而加速对抗对比学习(ACL)。RCS将核心集选择问题转化为子模最大化任务,实现高效贪心优化并具备理论最优性保证,在CIFAR-10和ImageNet-1K上实现最高4倍的加速,同时保持鲁棒性和迁移能力。

ABSTRACT

Adversarial contrastive learning (ACL) does not require expensive data annotations but outputs a robust representation that withstands adversarial attacks and also generalizes to a wide range of downstream tasks. However, ACL needs tremendous running time to generate the adversarial variants of all training data, which limits its scalability to large datasets. To speed up ACL, this paper proposes a robustness-aware coreset selection (RCS) method. RCS does not require label information and searches for an informative subset that minimizes a representational divergence, which is the distance of the representation between natural data and their virtual adversarial variants. The vanilla solution of RCS via traversing all possible subsets is computationally prohibitive. Therefore, we theoretically transform RCS into a surrogate problem of submodular maximization, of which the greedy search is an efficient solution with an optimality guarantee for the original problem. Empirically, our comprehensive results corroborate that RCS can speed up ACL by a large margin without significantly hurting the robustness transferability. Notably, to the best of our knowledge, we are the first to conduct ACL efficiently on the large-scale ImageNet-1K dataset to obtain an effective robust representation via RCS. Our source code is at https://github.com/GodXuxilie/Efficient_ACL_via_RCS.

研究动机与目标

  • 为解决对抗对比学习(ACL)的高计算成本问题,该方法需在每个周期内为所有训练数据生成对抗样本变体。
  • 开发一种无需标签信息的核心集选择方法,以加速ACL,从而可应用于无监督预训练。
  • 将自然数据与其虚拟对抗对应物之间的表征差异最小化,作为鲁棒表征质量的代理指标。
  • 提供一种理论基础坚实、高效的ACL核心集选择解决方案,利用子模优化实现最优性保证。
  • 首次在大规模ImageNet-1K数据集上通过核心集选择成功应用ACL。

提出的方法

  • RCS将核心集选择表述为最小化表征差异(RD),定义为自然数据及其虚拟对抗变体表示之间的距离。
  • 该问题被转化为一个代理子模最大化任务,已被证明是单调且γ-弱子模的,从而支持使用贪心选择并具备理论最优性边界。
  • 应用贪心算法选择核心集,利用虚拟对抗训练生成无需标签的扰动。
  • 该方法在预训练过程中迭代应用,每10个周期重新选择一次核心集,以适应不断演化的表征。
  • 该方法兼容无监督ACL和有监督对抗训练(SAT),具备广泛适用性。
  • 理论分析(定理1和定理2)建立了子模结构及贪心解的最优性保证。

实验结果

研究问题

  • RQ1无标签核心集选择方法能否在不降低鲁棒性的情况下有效加速对抗对比学习?
  • RQ2能否将ACL的核心集选择问题形式化为具有理论保证的子模优化问题?
  • RQ3RCS能否实现在ImageNet-1K等大规模数据集上的高效对抗预训练?
  • RQ4与随机核心集选择相比,RCS在鲁棒性迁移能力和训练效率方面表现如何?
  • RQ5RCS在有监督和无监督设置下,能否保持预训练模型在下游任务中的迁移能力?

主要发现

  • 与完整ACL相比,RCS在CIFAR-10和ImageNet-1K上实现最高4倍的训练时间加速,鲁棒性损失可忽略不计。
  • 在ImageNet-1K上,RCS首次实现了通过核心集选择成功应用对抗对比学习,实现了大规模下的鲁棒表征。
  • 在CIFAR-10上,RCS使用5%的子集比例,通过线性探测达到92.68%的标准测试准确率,优于随机选择(85.72%),并接近完整预训练(93.53%)。
  • 对于有监督对抗训练(SAT),RCS使用10%的子集比例在CIFAR-100上达到97.82%的SFF准确率,超过随机选择(95.60%),并接近完整SAT(98.09%)。
  • RCS保持了强大的鲁棒性迁移能力,在ImageNet-1K上使用5%核心集预训练后,CIFAR-100上AutoAttack下的鲁棒准确率达到75.35%。
  • 该方法兼容无监督ACL和有监督SAT,展示了在不同预训练范式下的广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。