Skip to main content
QUICK REVIEW

[论文解读] Syntactic Data Augmentation Increases Robustness to Inference Heuristics

Junghyun Min, R. Thomas McCoy|arXiv (Cornell University)|Apr 24, 2020
Topic Modeling参考文献 30被引用 13
一句话总结

本文通过主语/宾语倒装的句法数据增强方法,提升 BERT 在自然语言蕴涵任务中对句法推理启发法的鲁棒性。仅通过在 MNLI 训练集中加入 405 个句法转换示例,模型在 HANS 挑战集上的准确率——用于诊断对词序的敏感性——从 0.28 提升至 0.73,且在其他句法结构上也表现出泛化能力,支持‘遗漏连接’假说,而非表征不足假说。

ABSTRACT

Pretrained neural models such as BERT, when fine-tuned to perform natural language inference (NLI), often show high accuracy on standard datasets, but display a surprising lack of sensitivity to word order on controlled challenge sets. We hypothesize that this issue is not primarily caused by the pretrained model's limitations, but rather by the paucity of crowdsourced NLI examples that might convey the importance of syntactic structure at the fine-tuning stage. We explore several methods to augment standard training sets with syntactically informative examples, generated by applying syntactic transformations to sentences from the MNLI corpus. The best-performing augmentation method, subject/object inversion, improved BERT's accuracy on controlled examples that diagnose sensitivity to word order from 0.28 to 0.73, without affecting performance on the MNLI test set. This improvement generalized beyond the particular construction used for data augmentation, suggesting that augmentation causes BERT to recruit abstract syntactic representations.

研究动机与目标

  • 调查 BERT 在句法挑战性 NLI 示例上表现不佳是否源于微调过程中缺乏句法结构的暴露,而非固有的表征限制。
  • 检验在 MNLI 训练集中加入句法转换示例是否能提升 BERT 对词序和句法结构的敏感性。
  • 评估性能提升是否能在不同句法结构间泛化,以区分‘遗漏连接’与‘表征不足’假说。
  • 确定是否可通过极小规模、有针对性的数据增强显著提升模型鲁棒性,同时不损害标准基准上的性能。

提出的方法

  • 在 MNLI 句子子集上生成句法转换——主要为句法主语/宾语倒装——以创建增强的训练样本。
  • 在原始 MNLI 样本与新生成的句法增强样本组合数据集上微调 BERT。
  • 使用受控的 HANS 挑战集样例诊断模型对词序和句法结构的敏感性。
  • 评估模型在 HANS 子集上的表现,这些子集用于诊断词汇重叠、子序列和成分启发法,并比较不同增强规模下的表现。
  • 训练不同增强集大小(n=101, 405, 1215)的模型,以评估可扩展性与泛化能力。
  • 将模型在标准 MNLI 测试集上的表现与原始模型进行比较,确保标准任务准确率未出现显著下降。

实验结果

研究问题

  • RQ1在 MNLI 训练集中加入句法转换示例是否能提升 BERT 在自然语言蕴涵任务中对词序的敏感性?
  • RQ2数据增强带来的性能提升是否能泛化到增强过程中未使用的句法结构?
  • RQ3所观察到的性能提升是否支持‘遗漏连接’假说(即学习到的句法特征未被使用),而非‘表征不足’假说(即表征中缺乏句法特征)?
  • RQ4是否可通过极小规模数据增强(训练集大小的 0.1%)显著提升模型在句法挑战集上的鲁棒性,同时不损害其在标准基准上的性能?

主要发现

  • 通过主语/宾语倒装增强,BERT 在诊断词序敏感性的 HANS 示例上的准确率从 0.28 提升至 0.73,提升显著。
  • 性能提升在其他句法结构上也得到泛化:在关系从句示例上的准确率从 0.33 提升至 0.83,在被动语态结构上的准确率从 0.67 提升至 0.99。
  • 在标准 MNLI 测试集上的表现保持稳定,未出现显著下降,表明对标准 NLI 任务性能无负面影响。
  • 模型在子序列启发法和成分启发法诊断案例上的表现也有所提升,表明其句法鲁棒性更广泛。
  • 结果支持‘遗漏连接’假说,表明 BERT 已经学习到句法表征,但因缺乏强调句法结构的训练样本而未能有效使用这些表征。
  • 即使仅使用 405 个增强样本(占 MNLI 训练集的 0.1%),模型也取得了显著性能提升,表明该增强方法具有极高的数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。