[论文解读] Assessing Phrasal Representation and Composition in Transformers
本文通过控制实验系统评估了最先进Transformer模型在短语表征与组合方面的表现,这些实验将词汇效应与真正的组合意义分离。研究发现,尽管模型强烈反映了词语内容,但在控制词汇重叠后,其在短语层面的组合理解能力表现微弱,性能显著下降。
Deep transformer models have pushed performance on NLP tasks to new limits, suggesting sophisticated treatment of complex linguistic inputs, such as phrases. However, we have limited understanding of how these models handle representation of phrases, and whether this reflects sophisticated composition of phrase meaning like that done by humans. In this paper, we present systematic analysis of phrasal representations in state-of-the-art pre-trained transformers. We use tests leveraging human judgments of phrase similarity and meaning shift, and compare results before and after control of word overlap, to tease apart lexical effects versus composition effects. We find that phrase representation in these models relies heavily on word content, with little evidence of nuanced composition. We also identify variations in phrase representation quality across models, layers, and representation types, and make corresponding recommendations for usage of representations from these models.
研究动机与目标
- 探究最先进Transformer模型是否在简单词语内容之外实现了复杂的短语意义组合。
- 区分短语嵌入中由词汇重叠驱动的表征与真正的组合意义。
- 分析不同模型、层和表征类型(如[CLS]、Avg-Phrase)下短语表征质量的差异。
- 基于预期用途(如词语内容保真度与组合意义)提供选择最优表征的实际建议。
提出的方法
- 采用基于人类对短语相似性与意义变化判断的短语相似性与改写分类基准,并进行适配。
- 创建了数据集的受控版本,通过消除词汇重叠的线索,以隔离组合效应与词汇效应。
- 应用经典词义选择测试(如Kintsch, 2001)来评估短语层面的组合能力。
- 对多个模型(BERT、RoBERTa、DistilBERT、XLNet和XLM-RoBERTa)进行逐层分析。
- 评估了多种表征类型:[CLS]、[SEP]、[CLS]标记和词片嵌入的平均值(Avg-Phrase)。
- 在非受控与受控设置之间比较结果,以分离词汇内容与组合意义的贡献。
实验结果
研究问题
- RQ1在不考虑词汇重叠的情况下,Transformer表征在多大程度上反映了双词短语的真实组合意义?
- RQ2短语表征质量在不同模型(如BERT、RoBERTa、DistilBERT)和层之间如何变化?
- RQ3哪种表征类型(如[CLS]、Avg-Phrase、核心词)最能捕捉短语意义或词语内容?
- RQ4标志性组合测试(如词义选择)是否可靠地衡量了组合理解能力,还是受到词汇线索的干扰?
- RQ5我们能否识别出特定的模型配置(模型、层、表征类型),以最佳支持下游任务中的忠实短语表征?
主要发现
- 在不控制词汇重叠的情况下,模型与人类对短语相似性的判断高度相关,并在改写分类任务中表现优异。
- 在控制词汇重叠后,相似性与分类任务的性能显著下降,表明模型的成功主要由词汇内容驱动,而非组合意义。
- RoBERTa在后期层的Avg-Phrase表征,以及XLM-RoBERTa在后期层的Avg-Phrase表征(当短语处于句子上下文时),显示出最具希望的组合敏感性迹象。
- DistilBERT在最终层的[CLS]标记表征在所有[CLS]表征中表现最强,但其组合保真度仍有限。
- [CLS]标记通常不适用于短语表征,即使在最终层,除DistilBERT外均表现不佳。
- 标志性词义选择测试的结果与非受控相似性任务平行,表明其也可能受词汇效应影响,而非真正反映组合能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。