[论文解读] Zero-shot Temporal Relation Extraction with ChatGPT
本文使用三种提示策略——零样本提示、事件排序提示和思维链(CoT)提示——评估了ChatGPT在零样本时间关系抽取中的能力。尽管与监督模型相比性能差距显著,但思维链提示显著提升了结果,然而ChatGPT在一致性和长距离依赖推理方面表现出关键缺陷。
The goal of temporal relation extraction is to infer the temporal relation between two events in the document. Supervised models are dominant in this task. In this work, we investigate ChatGPT's ability on zero-shot temporal relation extraction. We designed three different prompt techniques to break down the task and evaluate ChatGPT. Our experiments show that ChatGPT's performance has a large gap with that of supervised methods and can heavily rely on the design of prompts. We further demonstrate that ChatGPT can infer more small relation classes correctly than supervised methods. The current shortcomings of ChatGPT on temporal relation extraction are also discussed in this paper. We found that ChatGPT cannot keep consistency during temporal inference and it fails in actively long-dependency temporal inference.
研究动机与目标
- 探究类似ChatGPT的大语言模型是否能在不微调的情况下执行零样本时间关系抽取。
- 评估不同提示工程技巧——零样本提示、事件排序提示和思维链(CoT)提示——对ChatGPT性能的影响。
- 识别ChatGPT在时间推理方面的局限性,特别是其在一致性和长距离依赖推理方面的问题。
- 将ChatGPT在低资源(小样本)时间关系类别上的表现与监督模型进行比较。
- 评估大语言模型是否可作为零样本时间关系抽取中监督方法的可行替代方案。
提出的方法
- 设计了一种零样本提示,直接要求ChatGPT根据预定义列表对两个事件之间的时间关系进行分类。
- 实现了事件排序提示,要求ChatGPT列出在给定事件触发词之前或之后发生的事件。
- 提出了一种思维链(CoT)提示策略,将任务分解为二分类步骤:首先检查特定关系(如“在……之前”)是否成立,然后逐步细化选择。
- 使用CoT方法引导逐步推理,通过利用中间推理状态提升置信度和准确性。
- 在标准时间关系抽取数据集上,使用F1和精确率/召回率等标准指标评估所有提示。
- 开展消融研究,比较不同提示类型的表现,并分析不一致性和长距离依赖问题的失败案例。

实验结果
研究问题
- RQ1ChatGPT能否在不进行任何微调的情况下有效执行零样本时间关系抽取?
- RQ2提示工程——特别是零样本提示、事件排序提示和思维链(CoT)提示——如何影响ChatGPT在时间关系抽取中的表现?
- RQ3尽管整体性能较低,ChatGPT是否在低资源(罕见)时间关系类别上优于监督模型?
- RQ4当对同一输入以不同但逻辑等价的问题形式多次提问时,ChatGPT在时间推理中保持一致性的程度如何?
- RQ5ChatGPT在处理长距离依赖时间关系和模糊时间线索时的主要局限性是什么?
主要发现
- ChatGPT与监督模型相比表现显著较差,性能差距与Bi-LSTM等传统神经网络相当或更差。
- 思维链(CoT)提示策略在所有数据集上均持续优于零样本提示和事件排序提示,表明结构化推理在提示设计中的重要性。
- ChatGPT在低频时间关系类别(如“模棱两可”、“相等”)上表现优于监督模型,表明其在罕见关系的零样本泛化方面可能存在优势。
- ChatGPT在时间推理中表现出严重不一致性:在相同文档上,当以不同但逻辑等价的问题提问时,可能产生冲突的时间关系判断,其中84%的案例在声称不确定后仍给出矛盾答案。
- ChatGPT无法有效处理长距离依赖时间关系,表明其在较长跨度上维持时间上下文的能力有限。
- 在CoT提示中,ChatGPT经常未能返回“模棱两可”,而是输出“无法确定”或“未知”等短语,这些在评估中被视为“模棱两可”,但仍导致多步推理中最终分类的不一致。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。