[论文解读] CERT: Contrastive Self-supervised Learning for Language Understanding
CERT 提出了一种对比自监督学习方法,用于语言表示学习,通过回译实现的句子级增强来微调类似 BERT 的模型。通过预测两个增强后的句子是否源自同一原始句子,CERT 改进了句子级语义表征,在 GLUE 的 11 项任务中有 7 项优于 BERT,并取得了更高的平均得分。
Pretrained language models such as BERT, GPT have shown great effectiveness in language understanding. The auxiliary predictive tasks in existing pretraining approaches are mostly defined on tokens, thus may not be able to capture sentence-level semantics very well. To address this issue, we propose CERT: Contrastive self-supervised Encoder Representations from Transformers, which pretrains language representation models using contrastive self-supervised learning at the sentence level. CERT creates augmentations of original sentences using back-translation. Then it finetunes a pretrained language encoder (e.g., BERT) by predicting whether two augmented sentences originate from the same sentence. CERT is simple to use and can be flexibly plugged into any pretraining-finetuning NLP pipeline. We evaluate CERT on 11 natural language understanding tasks in the GLUE benchmark where CERT outperforms BERT on 7 tasks, achieves the same performance as BERT on 2 tasks, and performs worse than BERT on 2 tasks. On the averaged score of the 11 tasks, CERT outperforms BERT. The data and code are available at https://github.com/UCSD-AI4H/CERT
研究动机与目标
- 解决现有预训练方法集中于标记级预测任务的局限性,这些方法可能无法充分捕捉全局句子级语义。
- 通过将预测任务从标记级转移到句子级,改进语言表征学习。
- 开发一种灵活、可插拔的预训练方法,与现有的 BERT 风格模型和微调流程兼容。
- 证明在句子级别进行对比自监督学习对自然语言理解的有效性。
- 通过消融研究,探究句子增强策略和预训练语料来源对模型性能的影响。
提出的方法
- 使用回译生成句子级数据增强:将源句子翻译为目标语言,再从目标语言回译回原始语言,生成语义相似但表达方式不同的版本。
- 使用动量对比(MoCo)进行对比自监督学习,其中每个增强后的句子作为查询,其他增强后的句子作为键。
- 将正样本对定义为源自同一原始句子的两个增强句子;负样本对则来自不同的原始句子。
- 使用对比损失训练模型,以最大化正样本对之间的相似性,同时最小化负样本对之间的相似性。
- 使用标注数据对生成的 CERT 模型在下游 NLP 任务上进行标准微调。
- 将 CERT 集成为灵活模块,可应用于任何预训练编码器(如 BERT、BART 或 RoBERTa)
实验结果
研究问题
- RQ1与标记级预训练相比,句子级别的对比自监督学习是否能提升语言表征?
- RQ2基于回译的句子增强与其它增强策略相比,在学习鲁棒句子表征方面表现如何?
- RQ3预训练语料的选择是否会影响 CERT 框架的性能?
- RQ4与标准 BERT 预训练相比,CERT 是否能在下游 NLU 任务中实现更好的泛化能力?
- RQ5与标记级目标相比,句子级别的对比学习目标是否更有效地捕捉全局语义结构?
主要发现
- CERT 在 GLUE 基准的 11 项任务中有 7 项优于 BERT,尤其在 SST-2、QNLI 和 RTE 任务上表现显著提升。
- 在全部 11 项 GLUE 任务的平均得分上,CERT 表现优于 BERT,表明其在整体语言理解能力上具有持续提升。
- 在两项任务(WNLI 和 WNLI-SNLI)上,CERT 与 BERT 表现相当,表明其在具有挑战性的语义相似性任务上具有竞争力。
- 在两项任务(WNLI 和 WNLI-SNLI)上,CERT 表现不如 BERT,表明其可能对任务特定特征或增强噪声较为敏感。
- 消融研究显示,CERT 的性能对预训练语料的选择和使用的回译增强数量敏感。
- 该方法作为插件模块有效:CERT 可应用于任何预训练编码器,且无需架构修改即可提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。