Skip to main content
QUICK REVIEW

[论文解读] MixUp Training Leads to Reduced Overfitting and Improved Calibration for the Transformer Architecture

Wancong Zhang, Ieshan Vaidya|arXiv (Cornell University)|Feb 22, 2021
Topic Modeling参考文献 11被引用 7
一句话总结

本文提出了一种针对 BERT 在 NLU 任务上微调的输入、流形和 CLS 级 MixUp 方法,通过嵌入的凸组合插值来提升泛化能力。实验表明,MixUp 在多种 NLU 任务中将测试损失和校准误差降低了高达 50%,尤其在低数据环境下对情感分类等简单任务具有显著优势。

ABSTRACT

MixUp is a computer vision data augmentation technique that uses convex interpolations of input data and their labels to enhance model generalization during training. However, the application of MixUp to the natural language understanding (NLU) domain has been limited, due to the difficulty of interpolating text directly in the input space. In this study, we propose MixUp methods at the Input, Manifold, and sentence embedding levels for the transformer architecture, and apply them to finetune the BERT model for a diverse set of NLU tasks. We find that MixUp can improve model performance, as well as reduce test loss and model calibration error by up to 50%.

研究动机与目标

  • 将计算机视觉中的数据增强技术 MixUp 扩展至自然语言理解(NLU)领域,适用于 Transformer 模型。
  • 通过在输入、流形和 CLS 级别提出嵌入级 MixUp 方法,解决直接插值文本输入的挑战。
  • 评估 MixUp 在多样化 NLU 任务和不同数据设置下对模型性能、测试损失和校准的影响。
  • 探究 MixUp 是否能提升 BERT 的泛化能力和不确定性估计,特别是在低资源条件下。

提出的方法

  • 提出 Input MixUp,通过使用 Beta 分布采样的混合系数 λ,对 BERT 的标记级隐藏表示进行凸组合插值。
  • 引入 Manifold MixUp,将 MixUp 应用于特定 Transformer 层 k 的隐藏表示,对表示和标签均使用相同的 λ。
  • 应用 CLS MixUp,一种仅混合 [CLS] 标记表示及其独热标签的变体。
  • 使用 Beta 分布(λ ~ β(α, α))在每个小批量中采样混合系数,其中 α 控制插值的平衡。
  • 使用标准交叉熵损失进行 BERT 模型训练,同时保持所有其他超参数和模型架构与基线一致。
  • 在五个 NLU 任务上进行评估:IMDb(情感)、AGNews(多分类)、CoLA(可接受性)、RTE(自然语言推理)和 BoolQ(问答),涵盖完整数据和低资源设置。

实验结果

研究问题

  • RQ1尽管直接插值原始文本存在困难,MixUp 是否能有效应用于 BERT Transformer 架构,并在多样化的 NLU 任务中取得良好效果?
  • RQ2在不同任务复杂度下,Input、Manifold 和 CLS 级 MixUp 变体在性能、测试损失和校准方面的表现如何比较?
  • RQ3MixUp 是否能减少 BERT 的过拟合并提升模型校准能力,特别是在低数据训练设置下?
  • RQ4对于不同类型的 NLU 任务(如情感分类与句法推理),每种 MixUp 变体在哪些任务上最有效?

主要发现

  • Manifold MixUp 将校准误差降低了高达 50%,显著改善了测试损失,即使在仅使用 32 个样本训练 IMDb 任务时也优于全数据基线。
  • 对于 IMDb 和 AGNews 等简单任务,Input 和 Manifold MixUp 在低资源条件下相比基线提升了准确率并降低了测试损失。
  • 在 CoLA、RTE 和 BoolQ 等复杂句法任务上,Input 和 Manifold MixUp 表现不如基线,而 CLS MixUp 保持了性能并降低了校准误差。
  • 所有 MixUp 变体均减少了模型过拟合,表现为训练过程中测试损失曲线更加平滑,其中 Manifold MixUp 在校准方面表现最一致。
  • CLS MixUp 提升了校准能力,且未牺牲复杂任务的性能,尽管其在 GLUE 任务上未提升预测准确率,与先前研究不同。
  • 本研究证实,MixUp 通过平滑决策边界和减少过拟合,显著增强了模型的鲁棒性和不确定性估计能力,尤其在低数据设置下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。