Skip to main content
QUICK REVIEW

[论文解读] HiddenCut: Simple Data Augmentation for Natural Language Understanding with Better Generalization

Jiaao Chen, Dinghan Shen|arXiv (Cornell University)|May 31, 2021
Topic Modeling参考文献 57被引用 5
一句话总结

HiddenCut 是一种简单而有效的数据增强方法,通过使用基于注意力的策略动态掩蔽隐藏表示中的连续跨度,从而提升预训练语言模型的泛化能力。它在 GLUE 基准测试中优于最先进方法,并通过促使模型依赖更广泛、更与任务相关的特征而非偶然模式,在分布外(OOD)和反事实样本上展现出更优的鲁棒性。

ABSTRACT

Fine-tuning large pre-trained models with task-specific data has achieved great success in NLP. However, it has been demonstrated that the majority of information within the self-attention networks is redundant and not utilized effectively during the fine-tuning stage. This leads to inferior results when generalizing the obtained models to out-of-domain distributions. To this end, we propose a simple yet effective data augmentation technique, HiddenCut, to better regularize the model and encourage it to learn more generalizable features. Specifically, contiguous spans within the hidden space are dynamically and strategically dropped during training. Experiments show that our HiddenCut method outperforms the state-of-the-art augmentation methods on the GLUE benchmark, and consistently exhibits superior generalization performances on out-of-distribution and challenging counterexamples. We have publicly released our code at https://github.com/GT-SALT/HiddenCut.

研究动机与目标

  • 为解决微调后的预训练语言模型在分布外数据上泛化能力差的问题,该问题源于对偶然模式的过拟合。
  • 通过在微调过程中正则化隐藏表示来提升模型鲁棒性,且无需依赖昂贵的数据收集或复杂扰动。
  • 开发一种数据增强技术,战略性地掩蔽隐藏空间中的连续跨度,同时保持语言连贯性并减少冗余。
  • 证明在隐藏空间中掩蔽结构化跨度可带来更优的特征学习和泛化性能,优于随机或输入空间的 dropout 方法。
  • 提供一种高效、无参数的正则化方法,可在多种自然语言理解任务中提升模型性能。

提出的方法

  • HiddenCut 在每个编码层之后的 Transformer 前馈层中掩蔽隐藏表示的连续跨度,而非在输入层或通过随机 dropout 实现。
  • 它使用基于注意力的机制识别并优先选择需掩蔽的信息丰富跨度,确保掩蔽具有策略性而非随机性。
  • 该方法基于注意力分数动态选择跨度,提升掩蔽过程的多样性与自适应性。
  • 在原始前向传播与增强前向传播之间应用 Jensen-Shannon 散度(JSD)一致性正则化,以保持标签一致性。
  • 掩蔽比例由超参数 α 控制,用于确定要删除的跨度长度;采样比例 β 控制候选集合的大小。
  • 该方法应用于微调阶段,无需额外模型参数或训练数据。

实验结果

研究问题

  • RQ1在隐藏空间中掩蔽连续跨度是否能超越随机 dropout 和输入空间增强,提升模型泛化能力?
  • RQ2基于注意力的跨度选择策略是否相比随机或均匀掩蔽能带来更好的性能与鲁棒性?
  • RQ3HiddenCut 在分布内与分布外的自然语言理解基准测试中与最先进数据增强方法相比表现如何?
  • RQ4掩蔽强度(由 α 控制)与模型性能之间的最优权衡是什么?
  • RQ5HiddenCut 如何影响注意力分布及模型对特定标记的依赖程度?

主要发现

  • HiddenCut 在 GLUE 基准测试中优于最先进数据增强方法,在 8 项自然语言理解任务中均取得最先进结果。
  • 在分布外和具有挑战性的反事实样本上,HiddenCut 稳定提升了泛化能力,尤其在模型因依赖偶然线索而失效的情况下表现更优。
  • 在 MNLI 上最佳性能对应 α = 0.1,表明中等程度扰动为最优——α 值过高会导致噪声过多,从而降低性能。
  • 在 SST-2 上,最优采样比例 β = 0.4 使准确率达到最高(95.76%),表明跨度选择在多样性与效率之间实现了良好平衡。
  • 注意力权重可视化显示,HiddenCut 促使注意力分布更加均匀,减少了对高注意力标记(如 '8 stars' 或 'intriguing')的过度依赖。
  • Jensen-Shannon 散度正则化有效维持了原始样本与增强样本之间的预测一致性,提升了模型鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。