Skip to main content
QUICK REVIEW

[论文解读] Preventing Manifold Intrusion with Locality: Local Mixup

Raphaël Baena, Lucas Drumetz|arXiv (Cornell University)|Jan 12, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出局部 Mixup(Local Mixup),一种数据增强技术,通过基于输入样本接近程度对 Mixup 虚拟样本进行加权,从而减少流形入侵,提升泛化能力。该方法在 CIFAR-10、Fashion-MNIST 和 SVHN 上的测试准确率均优于原始训练和标准 Mixup,通过单一局部性超参数实现了可学习的偏差-方差权衡。

ABSTRACT

Mixup is a data-dependent regularization technique that consists in linearly interpolating input samples and associated outputs. It has been shown to improve accuracy when used to train on standard machine learning datasets. However, authors have pointed out that Mixup can produce out-of-distribution virtual samples and even contradictions in the augmented training set, potentially resulting in adversarial effects. In this paper, we introduce Local Mixup in which distant input samples are weighted down when computing the loss. In constrained settings we demonstrate that Local Mixup can create a trade-off between bias and variance, with the extreme cases reducing to vanilla training and classical Mixup. Using standardized computer vision benchmarks , we also show that Local Mixup can improve test accuracy.

研究动机与目标

  • 为解决 Mixup 中远距离样本生成分布外或矛盾的虚拟样本所导致的流形入侵问题。
  • 提出一种具有局部感知能力的正则化方法,以在训练过程中控制偏差-方差权衡。
  • 证明在 Mixup 中引入局部结构可提升标准计算机视觉数据集上的泛化能力。
  • 通过单一超参数实现从原始训练到经典 Mixup 的连续插值。

提出的方法

  • 局部 Mixup 引入了一种基于距离的加权方案,其中虚拟样本的权重取决于输入样本对之间的欧氏距离。
  • 该方法使用一个由 α 参数化的平滑递减指数函数,以减弱远距离样本对的损失贡献。
  • 虚拟样本通过线性插值得到:x̃ = λxi + (1−λ)xj 和 ỹ = λyi + (1−λ)yj,但仅以依赖于 ||xi − xj|| 的权重参与损失计算。
  • 该方法允许从原始训练(α → 0)到标准 Mixup(α → ∞)的连续过渡,中间值可平衡偏差与方差。
  • 该方法在 CIFAR-10、Fashion-MNIST 和 SVHN 上使用标准架构(ResNet18、DenseNet、LeNet-5)进行评估,超参数选择以实现最优测试误差。

实验结果

研究问题

  • RQ1在 Mixup 中引入基于局部性的加权是否能减少流形入侵并提升泛化能力?
  • RQ2局部 Mixup 在低维和高维设置下如何影响偏差-方差权衡?
  • RQ3局部 Mixup 是否在标准视觉基准测试中始终优于标准 Mixup 和原始训练?
  • RQ4局部性超参数 α 对模型性能和利普希茨连续性有何影响?

主要发现

  • 在 CIFAR-10 上,当 α = 3e−3 时,局部 Mixup 的测试错误率为 4.03% ± 0.03,优于原始 ResNet18(4.98% ± 0.03)和标准 Mixup(4.13% ± 0.03)。
  • 在 Fashion-MNIST 上,当 α = 1e−3 时,局部 Mixup 的错误率为 5.97% ± 0.2,优于基线(6.20% ± 0.2)和 Mixup(6.36% ± 0.16)。
  • 在 SVHN 上,当 α = 5e−2 时,局部 Mixup 的错误率为 8.20% ± 0.13,优于原始 LeNet(10.01% ± 0.15)和 Mixup(8.31% ± 0.14)。
  • 该方法实现了从原始训练到经典 Mixup 的连续插值,极端情况分别对应无增强和完全 Mixup。
  • 实验表明,局部 Mixup 可调节训练模型利普希茨常数的下界,表明其提升了模型鲁棒性。
  • 使用其他图结构(如 K-近邻或阈值化)并未优于局部 Mixup,表明指数衰减加权在局部性控制方面具有有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。