[论文解读] MixUp as Directional Adversarial Training
本文揭示了 MixUp 等价于一种新型的对抗性训练方法,称为方向性对抗性训练(Directional Adversarial Training, DAT),其中样本被扰动向其他样本,同时保留其原始标签。本文提出了 Untied MixUp——一种广义的 MixUp 方案家族,与完整的 DAT 方法类别等价,并通过实验证明,某些 Untied MixUp 变体在 CIFAR-100 上的表现优于标准 MixUp,验证了其更强的正则化能力。
In this work, we explain the working mechanism of MixUp in terms of adversarial training. We introduce a new class of adversarial training schemes, which we refer to as directional adversarial training, or DAT. In a nutshell, a DAT scheme perturbs a training example in the direction of another example but keeps its original label as the training target. We prove that MixUp is equivalent to a special subclass of DAT, in that it has the same expected loss function and corresponds to the same optimization problem asymptotically. This understanding not only serves to explain the effectiveness of MixUp, but also reveals a more general family of MixUp schemes, which we call Untied MixUp. We prove that the family of Untied MixUp schemes is equivalent to the entire class of DAT schemes. We establish empirically the existence of Untied Mixup schemes which improve upon MixUp.
研究动机与目标
- 通过将 MixUp 与对抗性训练关联,理解其内在机制。
- 识别标准 MixUp 的局限性,并探索更有效的正则化方案。
- 提出 MixUp 的一种推广形式——Untied MixUp,使其超越标准形式。
- 通过实证评估 Untied MixUp 是否能在性能上超越标准 MixUp。
- 将 MixUp 推广至使用目标线性损失函数的模型,而不仅限于交叉熵损失。
提出的方法
- 提出方向性对抗性训练(DAT),其中通过将一个训练样本沿另一样本方向移动其间距离的 (1−λ) 比例进行扰动,并使用原始标签作为目标。
- 证明标准 MixUp 在期望损失和渐近优化方面,数学上等价于 DAT 的一个特定子类。
- 提出 Untied MixUp 作为 MixUp 的推广形式,其中输入和标签的混合系数分别从不同的 Beta 分布中独立采样。
- 证明整个 DAT 方案家族与 Untied MixUp 方案家族完全等价。
- 采用启发式搜索方法在 Untied MixUp 的策略空间 (α, β) 中寻找高性能配置。
- 为 MixUp 和 Untied MixUp 实现改进的训练流程,包括每样本独立采样 λ,以及每轮训练使用两份打乱的数据副本,以降低梯度的随机性。
实验结果
研究问题
- RQ1MixUp 是否本质上等价于一种对抗性训练形式?如果是,这种等价性的精确性质是什么?
- RQ2是否存在更广泛的对抗性训练方案类别,能够将 MixUp 的当前形式进一步推广?
- RQ3一种广义的 MixUp 形式——Untied MixUp,是否能实现比标准 MixUp 更好的泛化性能?
- RQ4所提出的 MixUp 推广形式是否适用于使用非交叉熵损失函数的模型?
- RQ5在实际中,Untied MixUp 是否能在具有挑战性的数据集上超越标准 MixUp?
主要发现
- Untied MixUp 在数学上等价于整个方向性对抗性训练(DAT)方案类别。
- 在 CIFAR-100 上,表现最佳的 Untied MixUp 策略(B(1.4,0.7))达到 21.863% 的测试错误率,优于最佳标准 MixUp 策略(B(0.9,0.9))的 21.942%。
- 在 CIFAR-10 上,Untied MixUp 展现出更小但一致的性能提升,平均错误率为 4.175%,而标准 MixUp 为 4.172%。
- 所提出的 MixUp 推广至目标线性损失函数(如 NC 损失)的方案已通过实证验证,表明 MixUp 和 Untied MixUp 在此类损失下依然有效。
- 改进的训练实现方式(独立采样 λ,使用两份打乱的数据副本)带来了更平稳的训练过程,尽管其主要贡献仍在于理论与方法论框架。
- 结果表明,当前的 MixUp 和 Untied MixUp 设计仍非最优,未来工作应探索针对每对训练样本的个性化混合策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。