[论文解读] How to Unleash the Power of Large Language Models for Few-shot Relation Extraction?
本文研究了使用大语言模型(LLMs)进行少样本关系抽取,提出了两种策略:与任务相关的指令和使用 GPT-3.5 进行模式约束的数据生成。结果表明,在上下文学习中,性能可与提示学习相媲美;而数据生成显著提升了结果,在四个基准数据集上实现了新的 SOTA F1 分数,其中在 SciERC 上的提升最高达 67.8%。
Scaling language models have revolutionized widespread NLP tasks, yet little comprehensively explored few-shot relation extraction with large language models. In this paper, we investigate principal methodologies, in-context learning and data generation, for few-shot relation extraction via GPT-3.5 through exhaustive experiments. To enhance few-shot performance, we further propose task-related instructions and schema-constrained data generation. We observe that in-context learning can achieve performance on par with previous prompt learning approaches, and data generation with the large language model can boost previous solutions to obtain new state-of-the-art few-shot results on four widely-studied relation extraction datasets. We hope our work can inspire future research for the capabilities of large language models in few-shot relation extraction. Code is available in https://github.com/zjunlp/DeepKE/tree/main/example/llm.
研究动机与目标
- 研究大语言模型(如 GPT-3.5)在少样本关系抽取中的潜力,尽管 LLM 在其他 NLP 领域已取得成功,但该任务仍研究不足。
- 解决由于复杂模式、噪声数据和庞大标签空间导致的少样本关系抽取性能低下问题。
- 通过提出两种有效策略——与任务相关的指令和使用 LLM 进行模式约束的数据生成,来提升少样本关系抽取性能。
- 通过实证验证在广泛使用的关系抽取基准上,上下文学习和数据生成策略的有效性。
- 为未来在低资源、模式丰富的 NLP 任务中利用 LLM 提供洞见和基础。
提出的方法
- 通过提供少样本示范,利用 GPT-3.5 进行上下文学习,引导模型预测实体之间的关系。
- 引入与任务相关的指令,明确实体和关系的角色,提升模型与关系抽取任务的一致性。
- 设计模式约束的数据生成方法,利用 LLM 自身生成高质量、符合模式的训练样本。
- 使用生成的数据微调现有的提示学习方法(如 KnowPrompt 和 TYP Marker),以提升少样本性能。
- 在四个基准数据集(TACRED、TACREV、RE-TACRED 和 SciERC)上进行详尽实验,采用 K=8 和 K=16 的少样本设置。
- 使用微 F1 作为评估指标,比较基线方法、上下文学习和数据生成策略的性能。
实验结果
研究问题
- RQ1与传统提示学习相比,使用 LLM 的上下文学习在少样本关系抽取中能否实现具有竞争力的性能?
- RQ2添加与任务相关的指令在多大程度上能提升 LLM 在少样本关系抽取中的性能?
- RQ3与上下文学习相比,LLM 生成的模式约束数据在多大程度上能显著提升少样本关系抽取性能?
- RQ4LLM 在少样本关系抽取中的局限性是什么?这些局限性如何影响其在长距离或模糊关系上的表现?
- RQ5在低资源关系抽取设置中,LLM 生成的数据是否优于或可补充人类标注的黄金数据?
主要发现
- 使用 GPT-3.5 的上下文学习在微 F1 上达到与以往提示学习方法相当的性能,在 TACRED(K=8)上为 31.9%,在 RE-TACRED(K=8)上为 49.9%。
- 引入与任务相关的指令后性能略有提升,在 TACRED(K=8)上达到 31.0%,在 RE-TACRED(K=8)上达到 51.8%。
- 模式约束的数据生成显著提升性能,在 RE-TACRED(K=8)上达到 64.3% 的 F1,在 SciERC(K=16)上达到 67.8%,创下新的 SOTA 结果。
- 人工评估确认,78% 的生成数据标注正确且质量较高,其中 TACRED 的准确率更高(85%),TACREV 为 82.5%。
- 在 TACRED 和 TACREV 上,生成数据的表现优于黄金数据,可能是因为原始数据集中存在噪声标注。
- LLM 在处理长距离实体关系、模糊关系标签以及语义相似的实体提及时表现不佳,表明其在推理和注意力机制方面存在局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。