Skip to main content
QUICK REVIEW

[论文解读] Metaphors in Pre-Trained Language Models: Probing and Generalization Across Datasets and Languages

Ehsan Aghazadeh, Mohsen Fayyaz|arXiv (Cornell University)|Mar 26, 2022
Language, Metaphor, and Cognition被引用 6
一句话总结

本文通过在四种语言(英语、西班牙语、俄语、波斯语)和四个隐喻检测数据集上探测上下文表示,研究预训练语言模型(PLMs)是否编码了隐喻知识。结果表明,隐喻知识主要编码在中间层,当标注一致时在不同语言间具有良好的泛化能力,但在不同数据集间(标注指南不一致时)则较弱。

ABSTRACT

Human languages are full of metaphorical expressions. Metaphors help people understand the world by connecting new concepts and domains to more familiar ones. Large pre-trained language models (PLMs) are therefore assumed to encode metaphorical knowledge useful for NLP systems. In this paper, we investigate this hypothesis for PLMs, by probing metaphoricity information in their encodings, and by measuring the cross-lingual and cross-dataset generalization of this information. We present studies in multiple metaphor detection datasets and in four languages (i.e., English, Spanish, Russian, and Farsi). Our extensive experiments suggest that contextual representations in PLMs do encode metaphorical knowledge, and mostly in their middle layers. The knowledge is transferable between languages and datasets, especially when the annotation is consistent across training and testing sets. Our findings give helpful insights for both cognitive and NLP scientists.

研究动机与目标

  • 确定预训练语言模型(PLMs)的上下文表示中是否编码了隐喻知识。
  • 评估隐喻知识在不同语言和数据集之间的泛化能力。
  • 探究隐喻信息在模型各层中的分布特征。
  • 评估标注一致性对跨语言和跨数据集迁移性能的影响。
  • 为PLMs在隐喻理解中的认知合理性提供见解。

提出的方法

  • 使用两种方法探测PLM表示:边缘探测(edge probing)和最小描述长度(MDL)。
  • 在上下文表示上训练二分类器以预测隐喻性,测量准确率和可提取性。
  • 通过在一种语言上训练并在其他语言上测试(如英语→西班牙语、俄语、波斯语)进行跨语言探测。
  • 通过在一种数据集上训练并在其他数据集上测试(如LCC→TroFi、VUA POS/Verbs)进行跨数据集探测,固定训练样本数为3,838。
  • 使用多语言PLM(XLM-R)和单语BERT进行零样本迁移评估。
  • 分析各层性能,以识别编码隐喻知识最有效的层。

实验结果

研究问题

  • RQ1预训练语言模型是否在其上下文表示中编码了隐喻知识?
  • RQ2在Transformer架构的哪一层中,隐喻知识被最显著地编码?
  • RQ3隐喻知识在不同语言之间,尤其是在零样本设置下的迁移效果如何?
  • RQ4标注一致性如何影响PLMs在跨数据集上的隐喻检测泛化能力?
  • RQ5训练与测试数据之间的分布偏移在多大程度上影响性能?

主要发现

  • 隐喻知识编码在预训练语言模型的中间层,且在这些层中性能达到峰值。
  • 跨语言隐喻检测迁移表现优异(如从英语到西班牙语准确率达78.02%,到波斯语为77.3%,到俄语为78.04%),表明在标注一致时具有强泛化能力。
  • 跨数据集迁移性能显著低于分布内性能,大多数情况下绝对下降超过13%,尤其在标注指南不同时更为明显。
  • 最佳的跨数据集迁移发生在VUA POS与VUA Verbs之间(准确率分别为68.61%和67.15%),二者具有相似的标注流程和词性覆盖范围。
  • 随机基线模型在分布外设置下的准确率为54–64%,表明观察到的性能提升源于学习到的隐喻知识,而非标注偏差。
  • 跨语言与跨数据集性能之间的差距显著,某些情况下跨语言结果优于跨数据集超过10%,凸显了标注一致性的重要作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。