Skip to main content
QUICK REVIEW

[论文解读] Conditional BERT Contextual Augmentation

Xing Wu, Shangwen Lv|arXiv (Cornell University)|Dec 17, 2018
Topic Modeling参考文献 27被引用 13
一句话总结

本文提出了一种条件式 BERT 上下文增强方法,这是一种新颖的数据增强方法,通过使用标签条件化的掩码语言模型(C-MLM)微调 BERT,生成语义一致且与标签兼容的句子变体。该方法在应用于 CNN 和 RNN 分类器时,显著提升了六大数据集上的文本分类性能,优于现有基线方法,并支持风格迁移应用。

ABSTRACT

We propose a novel data augmentation method for labeled sentences called conditional BERT contextual augmentation. Data augmentation methods are often applied to prevent overfitting and improve generalization of deep neural network models. Recently proposed contextual augmentation augments labeled sentences by randomly replacing words with more varied substitutions predicted by language model. BERT demonstrates that a deep bidirectional language model is more powerful than either an unidirectional language model or the shallow concatenation of a forward and backward model. We retrofit BERT to conditional BERT by introducing a new conditional masked language model\footnote{The term "conditional masked language model" appeared once in original BERT paper, which indicates context-conditional, is equivalent to term "masked language model". In our paper, "conditional masked language model" indicates we apply extra label-conditional constraint to the "masked language model".} task. The well trained conditional BERT can be applied to enhance contextual augmentation. Experiments on six various different text classification tasks show that our method can be easily applied to both convolutional or recurrent neural networks classifier to obtain obvious improvement.

研究动机与目标

  • 为了解决现有文本数据增强方法在词语替换过程中无法保持标签兼容性的问题。
  • 通过利用 BERT 的深度双向表示并结合标签条件化预测,提升上下文增强的效果。
  • 开发一种适用于卷积神经网络和循环神经网络分类器的通用型数据增强框架。
  • 探索条件式 BERT 在分类任务之外的潜力,特别是其在风格迁移任务中的应用。

提出的方法

  • 使用一种新颖的条件式掩码语言模型(C-MLM)目标对 BERT 进行微调,该目标基于上下文和句子标签来预测词语。
  • 通过在输入句子中随机掩码标记,并训练模型预测与标签兼容的替换词,来应用 C-MLM。
  • 利用微调后的条件式 BERT 模型,通过将掩码词语替换为预测出的与标签一致的替代词,生成增强的训练样本。
  • 将增强后的数据应用于训练 CNN 和 RNN 分类器,以完成文本分类任务。
  • 通过反转输入标签并利用相同的 C-MLM 机制生成具有相反情感的句子,将条件式 BERT 模型适配用于风格迁移。
  • 利用基于注意力的方法识别句子中与风格相关的词语,将其掩码并替换,以实现情感风格迁移。

实验结果

研究问题

  • RQ1是否可以有效微调基于深度双向 Transformer 的语言模型,以生成保持标签兼容性的数据增强样本?
  • RQ2在文本分类任务中,条件式 BERT 上下文增强方法相较于现有的基于替换和上下文增强的方法,在性能上表现如何?
  • RQ3条件式 BERT 模型在下游分类任务中,对不同神经网络架构(如 CNN 与 RNN)的泛化能力如何?
  • RQ4是否可以通过对目标情感标签进行条件化,将条件式 BERT 模型重新用于风格迁移?
  • RQ5条件式 BERT 达到优于标准 BERT 的数据增强性能所需的最优微调步数是多少?

主要发现

  • 当与 CNN 和 RNN 分类器结合使用时,条件式 BERT 上下文增强方法在六个不同类型的文本分类数据集上显著提升了分类准确率。
  • 该方法优于基线方法,包括同义词替换(使用 WordNet)、上下文增强(使用上下文)以及标签条件化上下文增强(使用上下文+标签)。
  • 条件式 BERT 仅需 1 至 6 个微调周期即可实现性能提升,表明其具有高效率和易于部署的特点。
  • 该模型表现出强大的泛化能力,微调所需周期数以超越标准 BERT 的性能范围为 1 至 6 个,具体取决于数据集和分类器。
  • 通过生成具有相反情感但保持句子结构和上下文一致性的句子,条件式 BERT 能够成功实现风格迁移。
  • 条件式 BERT 模型生成的句子变体在语义上连贯且与标签兼容,这一结论通过 SST2 数据集上的定性示例得到了验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。