Skip to main content
QUICK REVIEW

[论文解读] Psychologically-informed chain-of-thought prompts for metaphor understanding in large language models

Ben Prystawski, Paul H. Thibodeau|arXiv (Cornell University)|Sep 16, 2022
Language, Metaphor, and Cognition被引用 8
一句话总结

本文提出基于心理学启发的思维链提示,通过在认知心理学理论的潜在变量基础上结构化推理,提升大语言模型对隐喻的理解。当提示模型通过逐步推理分析主客体关系与隐喻意图时,GPT-3 模型(尤其是 Curie 和 DaVinci)在 paraphrase 选择准确率上显著提升,尤其在新颖或不熟悉的隐喻上,减少了对熟悉度的依赖。

ABSTRACT

Probabilistic models of language understanding are valuable tools for investigating human language use. However, they need to be hand-designed for a particular domain. In contrast, large language models (LLMs) are trained on text that spans a wide array of domains, but they lack the structure and interpretability of probabilistic models. In this paper, we use chain-of-thought prompts to introduce structures from probabilistic models into LLMs. We explore this approach in the case of metaphor understanding. Our chain-of-thought prompts lead language models to infer latent variables and reason about their relationships in order to choose appropriate paraphrases for metaphors. The latent variables and relationships chosen are informed by theories of metaphor understanding from cognitive psychology. We apply these prompts to the two largest versions of GPT-3 and show that they can improve performance in a paraphrase selection task.

研究动机与目标

  • 通过将认知心理学理论嵌入提示,弥合语言理解的概率模型与大语言模型(LLMs)之间的鸿沟。
  • 探究基于隐喻理解理论的思维链提示是否能提升大语言模型在隐喻 paraphrase 选择任务上的表现。
  • 通过诱导刻意且结构化的推理,减少大语言模型对隐喻熟悉度的依赖。
  • 评估不同推理结构(如讨论中的问题 vs. 主客体识别)对模型表现的影响。
  • 评估大语言模型在理论启发的推理步骤引导下,能否泛化到新颖隐喻。

提出的方法

  • 基于认知心理学中隐喻理解理论,开发了两种思维链提示:一种强调讨论中的问题,另一种聚焦于识别隐喻的主语和宾语。
  • 使用这些提示引导 GPT-3 模型(Curie 和 DaVinci)在选择隐喻的 paraphrase 前经历中间推理步骤。
  • 结构化推理以推断潜在变量(如隐喻意图、隐喻领域)及其关系,模仿概率推理模型。
  • 将提示应用于 Katz 隐喻语料库,该语料库包含人类标注 paraphrase 选项的隐喻。
  • 使用不同提示条件下 paraphrase 选择准确率的均值(4 分制)评估性能。
  • 对比零样本条件下有无推理链的性能,并分析隐喻熟悉度对模型行为的影响。

实验结果

研究问题

  • RQ1基于心理学启发的思维链提示能否提升大语言模型为隐喻选择合适 paraphrase 的能力?
  • RQ2提示大语言模型推理认知心理学模型中的潜在变量及其关系,是否能提升其在隐喻理解任务上的表现?
  • RQ3推理结构(如聚焦于讨论中的问题 vs. 主客体识别)是否会影响模型表现?
  • RQ4思维链提示在多大程度上减少了大语言模型在 paraphrase 选择中对隐喻熟悉度的依赖?
  • RQ5此类提示能否在熟悉度启发式方法失效的新颖或不熟悉隐喻上提升表现?

主要发现

  • Curie 在使用思维链提示后表现显著提升,尤其当推理链突出讨论中的问题时,表明结构化推理有助于模型进行刻意处理。
  • DaVinci 即使无推理链也表现良好(均分 = 3.71/4.0),但当使用推理链时,其表现更稳定且对熟悉度的依赖更小,表明推理链可减少熟悉度偏差。
  • 模型的推理通常逻辑严谨,但有时未能将语义特征(如“holding soil”与“stabilizing”)正确关联到对应 paraphrase,显示出尽管中间步骤正确,仍存在推理断层。
  • 一种模型错误表现为正确识别出某一特征(如“beautiful”对应“Love is a flower”),但未能将其与对应 paraphrase 选项关联,表明最终选择存在脱节。
  • 在无推理链时,隐喻熟悉度对性能影响显著,但在有推理链时则不显著,支持了思维链提示可促进更刻意、更少依赖启发式推理的假设。
  • 尽管在熟悉隐喻上表现强劲,DaVinci 在无推理链时难以应对新颖隐喻,表明推理链在处理不熟悉或复杂修辞语言时可能尤为重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。