[论文解读] Question Answering Infused Pre-training of General-Purpose Contextualized Representations
本文提出问题回答融合预训练(QuIP),一种新颖的预训练目标,通过让双编码器模型在8000万个合成问答对上匹配交叉编码器的预测结果,来增强通用上下文表征。QuIP在多个NLP任务中提升了零样本和少样本性能,在少样本命名实体识别任务中相比RoBERTa-large最高提升14 F1分,在零样本情感分析任务中提升5个百分点准确率。
We propose a pre-training objective based on question answering (QA) for learning general-purpose contextual representations, motivated by the intuition that the representation of a phrase in a passage should encode all questions that the phrase can answer in context. To this end, we train a bi-encoder QA model, which independently encodes passages and questions, to match the predictions of a more accurate cross-encoder model on 80 million synthesized QA pairs. By encoding QA-relevant information, the bi-encoder's token-level representations are useful for non-QA downstream tasks without extensive (or in some cases, any) fine-tuning. We show large improvements over both RoBERTa-large and previous state-of-the-art results on zero-shot and few-shot paraphrase detection on four datasets, few-shot named entity recognition on two datasets, and zero-shot sentiment analysis on three datasets.
研究动机与目标
- 在无需大量微调的情况下,提升通用上下文表征在零样本和少样本学习设置下的实用性。
- 解决掩码语言建模的局限性,后者优化的是非上下文嵌入,而非上下文丰富、可立即使用的表征。
- 探究在问答对上进行训练是否能生成编码对多种下游任务具有相关语义内容的表征。
- 研究从更准确的交叉编码器到双编码器的知识蒸馏是否能产生稳健且可迁移的表征。
- 证明基于问答的提示和表征可作为多种NLP任务少样本适应的统一接口。
提出的方法
- 使用在大规模段落语料上训练的问题生成模型,合成8000万个问答对。
- 训练一个交叉编码器问答模型作为教师,对合成的问答对生成高精度预测。
- 使用知识蒸馏训练一个双编码器模型,该模型独立编码段落和问题,以匹配交叉编码器的预测结果。
- 使用对比损失优化双编码器,以最大化段落片段表征与它们所回答的问题表征之间的相似度。
- 通过基于提示的微调或特征提取,利用双编码器的token级表征进行下游任务。
- 在下游任务(如情感分析和命名实体识别)中应用问题提示,实现无需任务特定微调的零样本和少样本适应。
实验结果
研究问题
- RQ1在问答对上进行预训练是否能产生在零样本和少样本设置下可立即使用的上下文表征?
- RQ2从交叉编码器到双编码器的知识蒸馏是否能提升下游任务的上下文表征质量?
- RQ3基于问答的提示是否能有效初始化或引导少样本学习场景下的下游模型?
- RQ4在多种NLP任务中,QuIP与RoBERTa-large及其他SOTA方法在零样本和少样本设置下的表现如何比较?
- RQ5QuIP成功的关键组件是什么——真实问题、强教师模型、双编码器架构,还是问题生成策略?
主要发现
- 与之前工作相比,QuIP在四个数据集上的少样本释义检测任务中F1提升9分,使用BERTScore特征。
- QuIP结合问题嵌入初始化,在两个少样本命名实体识别数据集中相比RoBERTa-large提升14 F1分。
- 在零样本情感分析中,QuIP使用问题提示相比RoBERTa-large使用MLM风格提示,准确率提升5个百分点。
- 该方法能提取可解释的情感预测依据,作为副作用展示了模型的透明性。
- 消融实验证实,真实问题、强教师模型和双编码器架构是QuIP成功的关键因素。
- 问题生成解码策略及其他设计选择对性能无定性影响,表明该方法具有鲁棒性和稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。