[论文解读] Large Language Models as Financial Data Annotators: A Study on Effectiveness and Efficiency
本研究评估了大型语言模型(LLMs)如GPT-4、PaLM 2和MPT Instruct在特定领域金融文档中的关系抽取任务中作为金融数据标注者的性能。结果表明,通过优化提示工程,LLMs在准确性和效率方面可达到甚至超过非专家众包工作者的水平,同时引入了一种可靠性指数(LLM-RelIndex),用于标记不确定的预测结果以供专家审查,从而减少对昂贵专家标注的依赖。
Collecting labeled datasets in finance is challenging due to scarcity of domain experts and higher cost of employing them. While Large Language Models (LLMs) have demonstrated remarkable performance in data annotation tasks on general domain datasets, their effectiveness on domain specific datasets remains underexplored. To address this gap, we investigate the potential of LLMs as efficient data annotators for extracting relations in financial documents. We compare the annotations produced by three LLMs (GPT-4, PaLM 2, and MPT Instruct) against expert annotators and crowdworkers. We demonstrate that the current state-of-the-art LLMs can be sufficient alternatives to non-expert crowdworkers. We analyze models using various prompts and parameter settings and find that customizing the prompts for each relation group by providing specific examples belonging to those groups is paramount. Furthermore, we introduce a reliability index (LLM-RelIndex) used to identify outputs that may require expert attention. Finally, we perform an extensive time, cost and error analysis and provide recommendations for the collection and usage of automated annotations in domain-specific settings.
研究动机与目标
- 评估LLMs在金融关系抽取任务中作为标注者的有效性和效率。
- 在REFinD数据集上将LLM输出与专家和众包工作者的标注结果进行对比。
- 识别适用于金融领域任务的最佳提示工程策略和模型配置。
- 开发并验证一种可靠性指数(LLM-RelIndex),用于识别需要专家审查的LLM输出。
- 为在特定领域数据标注流程中部署LLMs提供可操作的建议。
提出的方法
- 在REFinD数据集上评估三种LLM——GPT-4、PaLM 2和MPT Instruct在金融关系抽取任务中的表现。
- 采用零样本、少样本和思维链(chain-of-thought)提示策略,评估提示工程的影响。
- 系统性地调整温度(temperature)和随机种子(random seed),以评估模型的一致性和鲁棒性。
- 设计并实现LLM-RelIndex,一种基于置信度的指标,用于对预测可靠性进行排序。
- 使用F1值、精确率、召回率和误差分析,对LLM、众包工作者和专家标注结果进行定量比较。
- 对不同模型配置下的时间、成本和误差进行分析,以评估实际部署中的权衡。
实验结果
研究问题
- RQ1LLMs能否在金融关系抽取任务中实现与非专家众包工作者相当的标注质量?
- RQ2不同的提示策略(零样本、少样本、思维链)如何影响LLM在金融关系任务中的表现?
- RQ3温度(temperature)和随机种子(random seed)对LLM一致性与可靠性有何影响?
- RQ4可靠性指数(LLM-RelIndex)能否有效识别出需要专家验证的LLM预测?
- RQ5在金融数据标注中,使用LLMs与使用众包工作者或专家相比,其时间、成本和误差之间的权衡如何?
主要发现
- 采用少样本提示和思维链推理的GPT-4在LLM中取得了最高的F1值(0.82),优于众包工作者和未优化的LLM。
- 使用与关系相关的示例进行定制化提示显著提升了LLM性能,尤其在区分细微金融关系(如'formed on'与'acquired on')方面表现突出。
- LLM-RelIndex成功识别出87%的高风险预测,这些预测需要专家审查,从而减少了对完整专家标注的依赖。
- 与众包工作者相比,LLMs将标注成本降低了60%;与专家标注相比,成本降低了80%,同时在70%的数据集上保持了可接受的准确率。
- 尽管置信度较高,LLMs在15%的案例中仍出现系统性错误——尤其是在区分相似关系(如'subsidiary of'与'agreement with')时——凸显了可靠性过滤的必要性。
- 研究发现,LLMs可替代非专家众包工作者完成约70%的金融关系抽取任务,而专家审查仅需覆盖剩余的30%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。