[论文解读] CFBenchmark: Chinese Financial Assistant Benchmark for Large Language Model
CFBenchmark 引入了一个全面的基准,用于评估中文金融大语言模型(LLMs)在三个核心能力方面的表现:金融识别、分类和生成。该基准在涵盖八个任务的3,917篇中文金融文本上评估了22个 LLM,结果表明,尽管某些模型在特定任务中表现优异,但没有一个模型在所有任务中均表现出色,凸显了在金融文本处理能力方面仍有巨大提升空间。
Large language models (LLMs) have demonstrated great potential in the financial domain. Thus, it becomes important to assess the performance of LLMs in the financial tasks. In this work, we introduce CFBenchmark, to evaluate the performance of LLMs for Chinese financial assistant. The basic version of CFBenchmark is designed to evaluate the basic ability in Chinese financial text processing from three aspects~(\emph{i.e.} recognition, classification, and generation) including eight tasks, and includes financial texts ranging in length from 50 to over 1,800 characters. We conduct experiments on several LLMs available in the literature with CFBenchmark-Basic, and the experimental results indicate that while some LLMs show outstanding performance in specific tasks, overall, there is still significant room for improvement in basic tasks of financial text processing with existing models. In the future, we plan to explore the advanced version of CFBenchmark, aiming to further explore the extensive capabilities of language models in more profound dimensions as a financial assistant in Chinese. Our codes are released at https://github.com/TongjiFinLab/CFBenchmark.
研究动机与目标
- 为解决缺乏针对中文金融 LLM 的领域特定基准的问题。
- 设计一个基准,全面评估 LLM 在中文金融文本处理基础任务上的表现。
- 识别现有 LLM 在处理真实世界中文金融文本数据时的性能差距。
- 通过结构化的评估框架,为未来先进金融 AI 助手的发展提供基础。
- 通过与通用模型的对比,展示领域自适应微调的有效性。
提出的方法
- CFBenchmark-Basic 由 3,917 篇高质量中文金融文本构成,长度从 50 个字符到 1,800 个字符以上不等。
- 该基准分为三个主要评估方面:金融识别(公司与产品)、分类(情感、行业、事件)和生成(摘要、投资建议、风险预警)。
- 每个任务均配有经人工验证的标签,以确保数据质量与现实世界的一致性。
- 实验在零样本和少样本设置下,针对 22 个预训练及微调过的 LLM 进行。
- 性能通过标准指标(如 F1 分数和准确率)进行评估,结果在任务和模型类别间进行聚合。
- 对领域特定模型(如 CFGPT1-sft-7B-LoRA)进行微调,并与通用多语言和双语模型进行对比,以评估领域适应的影响。
实验结果
研究问题
- RQ1现有 LLM 在中文金融文本处理基础任务上的表现如何?
- RQ2当前 LLM 在金融识别、分类和生成方面存在哪些性能差距?
- RQ3与通用模型相比,领域特定微调如何影响 LLM 在金融任务上的表现?
- RQ4为何一些模型尽管整体能力较强,却在特定任务上表现不佳?
- RQ5多语言模型在金融文本理解方面相比单语中文模型表现差多少?
主要发现
- 没有任何公开的 LLM 在三个主要评估方面(识别、分类、生成)的 F1 分数均超过 0.6,表明仍有巨大提升空间。
- ERNIE-Bot-4 在金融识别任务中表现最佳,F1 得分为 0.618;而 InternLM-20B 在金融生成任务中领先,得分为 0.695。
- Baichuan2-13B-Chat 在内容生成任务中得分最高,达 0.706,但其生成结果往往过于通用且重复,尤其在风险预警生成任务中更为明显。
- 多语言模型(如 Falcon 和 BLOOMZ)的表现不如同尺寸的双语中文-英文模型,凸显了针对语言特定预训练在金融任务中的重要性。
- 经过领域适应的模型(如 CFGPT1-sft-7B-LoRA)优于通用模型及其全参数对应模型,证明了在金融数据上进行微调的有效性。
- 参数量更高的模型通常表现更优,尤其在信息抽取任务中,凸显了处理复杂金融数据对模型容量的需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。