Skip to main content
QUICK REVIEW

[论文解读] Chinese Fine-Grained Financial Sentiment Analysis with Large Language Models

Yinyu Lan, Yanru Wu|arXiv (Cornell University)|Jun 25, 2023
Stock Market Forecasting Methods被引用 4
一句话总结

本文介绍了FinChina SA,一个大规模中文细粒度金融情感分析数据集,包含11,036篇新闻文章、8,739家上市公司、190种预警类型以及21,272个情感标注。通过指令微调和对话微调两种方式评估了开源大语言模型,结果显示中文版LLaMA Plus在情感分类任务中达到75.99%的准确率,优于BLOOMZ和ChatGLM等模型;而ChatGPT在零样本设置下表现欠佳,归因于其在金融领域知识上的局限性。

ABSTRACT

Entity-level fine-grained sentiment analysis in the financial domain is a crucial subtask of sentiment analysis and currently faces numerous challenges. The primary challenge stems from the lack of high-quality and large-scale annotated corpora specifically designed for financial text sentiment analysis, which in turn limits the availability of data necessary for developing effective text processing techniques. Recent advancements in large language models (LLMs) have yielded remarkable performance in natural language processing tasks, primarily centered around language pattern matching. In this paper, we propose a novel and extensive Chinese fine-grained financial sentiment analysis dataset, FinChina SA, for enterprise early warning. We thoroughly evaluate and experiment with well-known existing open-source LLMs using our dataset. We firmly believe that our dataset will serve as a valuable resource to advance the exploration of real-world financial sentiment analysis tasks, which should be the focus of future research. The FinChina SA dataset is publicly available at https://github.com/YerayL/FinChina-SA

研究动机与目标

  • 为解决中文金融情感分析领域高质量、大规模标注语料库的缺乏问题。
  • 构建一个面向实体级别的金融领域细粒度情感分析基准数据集。
  • 评估开源大语言模型及ChatGPT在零样本和微调设置下的金融情感分析任务表现。
  • 探究基于指令和基于对话的微调在金融NLP任务中的可行性和性能。
  • 识别通用大语言模型(如ChatGPT)在特定金融领域情感理解方面的局限性。

提出的方法

  • 从主要中文金融网站爬取并清洗金融新闻,构建FinChina SA数据集。
  • 对每篇新闻文章进行公司名称、情感极性及预警类型的标注,共生成21,272个情感样本。
  • 采用单轮问答格式的指令微调方法和多轮对话模板的对话微调方法对开源大语言模型进行微调。
  • 通过零样本提示方式使用ChatGPT进行评估,并对比不同模型在情感分类和预警类型检测任务中的表现。
  • 应用P-tuning v2等高效参数微调方法以降低显存占用,但导致准确率有所下降。
  • 在多轮问答微调中采用轮次式提示策略,将模型的前一轮输出作为后续输入的一部分。

实验结果

研究问题

  • RQ1开源大语言模型在中文细粒度金融情感分析任务中,于零样本和微调设置下的有效性如何?
  • RQ2基于指令和基于对话的微调能否提升金融情感分类任务的性能?
  • RQ3为何尽管具备强大的通用NLP能力,ChatGPT在金融情感分析中仍表现不佳?
  • RQ4领域特定预训练在多大程度上能提升大语言模型在金融文本理解任务中的表现?
  • RQ5将单轮数据转化为多轮对话格式,是否能提升模型在金融情感分析任务中的性能?

主要发现

  • 中文版LLaMA Plus在情感分类任务中取得最高准确率75.99%,优于BLOOMZ(75.52)和ChatGLM(74.46)。
  • ChatGPT在零样本设置下表现较差,表明其对金融领域特有表达方式和情感知识理解有限。
  • 微调后的大语言模型显著优于Longformer模型,证明其在金融NLP任务中具备有效的迁移学习能力。
  • 基于对话的微调(使用模板转换的多轮对话数据)导致模型输出重复且错误频发,表明其在本任务中效果不如基于指令的微调。
  • P-tuning v2虽降低了显存使用,但造成显著的准确率下降,表明效率与性能之间存在权衡。
  • FinChina SA数据集已公开发布于https://github.com/YerayL/FinChina-SA,可作为未来金融情感分析研究的重要基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。