Skip to main content
QUICK REVIEW

[论文解读] Large Language Models in Finance: A Survey

Yinheng Li, Shaofei Wang|arXiv (Cornell University)|Sep 28, 2023
Topic Modeling被引用 7
一句话总结

本综述全面概述了大型语言模型(LLMs)在金融领域的应用,评估了零样本提示、微调以及在金融自然语言处理任务中自定义训练等技术。它提出了一套决策框架,指导从业者根据数据、计算资源和性能约束选择 LLM 策略,为金融应用中负责任的采用提供了实用路线图。

ABSTRACT

Recent advances in large language models (LLMs) have opened new possibilities for artificial intelligence applications in finance. In this paper, we provide a practical survey focused on two key aspects of utilizing LLMs for financial tasks: existing solutions and guidance for adoption. First, we review current approaches employing LLMs in finance, including leveraging pretrained models via zero-shot or few-shot learning, fine-tuning on domain-specific data, and training custom LLMs from scratch. We summarize key models and evaluate their performance improvements on financial natural language processing tasks. Second, we propose a decision framework to guide financial professionals in selecting the appropriate LLM solution based on their use case constraints around data, compute, and performance needs. The framework provides a pathway from lightweight experimentation to heavy investment in customized LLMs. Lastly, we discuss limitations and challenges around leveraging LLMs in financial applications. Overall, this survey aims to synthesize the state-of-the-art and provide a roadmap for responsibly applying LLMs to advance financial AI.

研究动机与目标

  • 整合当前大型语言模型(LLMs)在金融应用中的研究现状,重点关注实用解决方案与部署策略。
  • 识别并评估关键 LLM 技术(如零样本、少样本、微调和自定义训练)在金融自然语言处理任务中的表现。
  • 通过提出基于数据、计算资源和性能约束的结构化决策框架,弥补金融专业人士在选择 LLM 解决方案方面缺乏指导的空白。
  • 突出 LLM 在受监管金融环境中可能存在的风险,如幻觉、偏见以及可解释性不足。
  • 为金融领域 LLM 的负责任且可扩展的采用提供路线图,涵盖从轻量级实验到完全自定义的各个阶段。

提出的方法

  • 使用技术分类法对现有金融领域 LLM 应用进行调研:零样本/少样本提示、在特定领域金融数据上的微调,以及从零开始训练自定义 LLM。
  • 使用标准指标(如 F1 分数、精确率、召回率、MAPE、RMSE 和 R²)以及领域特定指标(如回测中的夏普比率和总收益)评估 LLM 在金融自然语言处理任务中的表现。
  • 提出一个决策框架,指导从业者根据数据可用性、计算资源和性能需求,从低成本的现成 LLM 逐步过渡到高投入的微调或自定义模型。
  • 应用检索增强生成(RAG)技术,以减少金融文本生成中的幻觉并提高事实准确性。
  • 使用全面的评估系统(如 Liang 等人,2022 年提出的系统)从多个维度评估 LLM 输出的公平性、鲁棒性、偏见和准确性。
  • 分析模型幻觉、种族、性别和宗教偏见,以及尽管具备推理能力但其黑箱性质仍带来的局限性。
Figure 1. Decision process flow chart
Figure 1. Decision process flow chart

实验结果

研究问题

  • RQ1不同 LLM 技术(零样本、少样本、微调和自定义训练)在金融自然语言处理任务(如情感分析、问答和摘要)中的表现如何?
  • RQ2在选择金融应用的 LLM 策略时,成本、性能和资源需求之间的主要权衡是什么?
  • RQ3金融专业人士如何基于其数据和运营约束,系统性地在现成模型、微调模型和自定义 LLM 之间进行选择?
  • RQ4在金融领域使用 LLM 的主要风险(如幻觉、偏见和缺乏可解释性)是什么,以及如何加以缓解?
  • RQ5与通用模型相比,LLM 在金融任务上的表现提升程度如何?性能指标(如夏普比率或收益)与准确率指标如何对齐?

主要发现

  • 在特定领域金融数据上对通用 LLM 进行微调,可显著提升其在金融自然语言处理任务(如情感分析、问答和摘要)中的性能。
  • 自定义训练的 LLM 在专业金融任务中表现优于通用模型和微调模型,尤其当其在大规模、高质量金融语料库上进行训练时。
  • 所提出的决策框架为从低成本零样本推理到高投入自定义 LLM 的可扩展路径提供了支持,使模型选择与数据可用性、计算能力及性能需求相匹配。
  • 检索增强生成(RAG)通过将响应基于外部知识源,有效减少了金融文本生成中的幻觉。
  • 内容审查和输出限制等偏见缓解技术在减少 LLM 生成的金融内容中的种族、性别和宗教偏见方面具有显著效果。
  • 回测中的夏普比率和总收益等性能指标在评估交易应用中的 LLM 时至关重要,但必须与准确率指标对齐,以防止过拟合并确保鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。