[论文解读] GPT-FinRE: In-context Learning for Financial Relation Extraction using Large Language Models
该论文提出 GPT-FinRE,一种基于 GPT-3.5 Turbo 和 GPT-4 的 few-shot in-context learning 框架,用于在 REFinD 数据集上的金融关系抽取。该方法采用两种检索策略——基于 OpenAI 嵌入的 KNN 和基于学习的 EPR 检索器——以选择相关演示样本,实现了 0.718 的 F1 分数,在共享任务中排名第三。
Relation extraction (RE) is a crucial task in natural language processing (NLP) that aims to identify and classify relationships between entities mentioned in text. In the financial domain, relation extraction plays a vital role in extracting valuable information from financial documents, such as news articles, earnings reports, and company filings. This paper describes our solution to relation extraction on one such dataset REFinD. The dataset was released along with shared task as a part of the Fourth Workshop on Knowledge Discovery from Unstructured Data in Financial Services, co-located with SIGIR 2023. In this paper, we employed OpenAI models under the framework of in-context learning (ICL). We utilized two retrieval strategies to find top K relevant in-context learning demonstrations / examples from training data for a given test example. The first retrieval mechanism, we employed, is a learning-free dense retriever and the other system is a learning-based retriever. We were able to achieve 3rd rank overall. Our best F1-score is 0.718.
研究动机与目标
- 为解决使用大型语言模型进行 few-shot 上下文学习时低资源金融关系抽取的挑战。
- 通过选择高质量的上下文演示样例,提升在 REFinD 数据集上的关系抽取性能。
- 评估不同检索策略——无学习与基于学习——在 few-shot LLM 提示中的有效性。
- 比较在上下文学习范式下,GPT-3.5 Turbo 与 GPT-4 在金融 NLP 任务中的性能表现。
- 通过提示工程与检索增强的 few-shot 学习,在 REFinD 基准上实现最先进结果。
提出的方法
- 将关系抽取任务表述为上下文学习,其中 LLM 基于包含任务描述、预定义关系类别和 K-shot 演示的提示生成预测。
- 使用基于 KNN 的检索器,结合 OpenAI 的 text-embedding-ada-002,在嵌入空间中为每个测试输入检索最相似的训练样本。
- 采用 EPR(高效提示检索)方法,基于 GPT-Neo-2.7B 训练,学习根据似然分数检索最优的上下文样本。
- 将检索到的样本与每类关系随机采样的样本结合,以增强提示的多样性并减少幻觉。
- 构建包含结构化组件的提示:任务定义、关系类别、K 个检索到的演示样本以及测试输入,用于生成。
- 在推理过程中,使用 FAISS 实现密集嵌入空间中的高效相似性搜索。
实验结果
研究问题
- RQ1GPT 模型在 REFinD 数据集上的金融关系抽取中,上下文学习的有效性如何?
- RQ2在 few-shot 关系抽取中,基于学习的检索器(EPR)是否优于无学习的检索器(基于 OpenAI 嵌入的 KNN)?
- RQ3在金融 NLP 的上下文学习中,LLM 的选择(GPT-3.5 Turbo 与 GPT-4)如何影响性能?
- RQ4将检索到的样本与每类关系的随机样本结合,对模型泛化能力和 F1 分数有何影响?
- RQ5在低资源金融关系抽取中,检索增强的上下文学习是否能在无需微调的情况下取得具有竞争力的结果?
主要发现
- GPT-4 在上下文学习中优于 GPT-3.5 Turbo,实现 0.697 的 F1 分数,高于 GPT-3.5 Turbo 的 0.643。
- 基于学习的 EPR 检索器显著优于无学习的 KNN(使用 OpenAI 嵌入),当与 GPT-4 结合时,实现 0.718 的 F1 分数。
- 表现最佳的配置为使用 EPR 检索 5 个样本,并为每类关系添加 4 个随机样本,实现最高的 F1 分数 0.718。
- EPR 与 GPT-4 的结合实现了最高性能,在 SIGIR 2023 共享任务中整体排名第三。
- 在每类关系中添加随机样本可提升性能,表明提示多样性与鲁棒性具有优势。
- 结果表明,检索质量是上下文学习中的关键因素,更优的样本可减少幻觉并提升泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。