Skip to main content
QUICK REVIEW

[论文解读] CatMemo at the FinLLM Challenge Task: Fine-Tuning Large Language Models using Data Fusion in Financial Applications

Yupeng Cao, Zhiyuan Yao|arXiv (Cornell University)|Jul 2, 2024
Stock Market Forecasting MethodsDecision Sciences被引用 3
一句话总结

本文提出一种数据融合方法,通过参数高效微调(PEFT)和LoRA对Llama3-8B与Mistral-7B进行微调,以提升其在金融NLP任务中的性能。在分类与摘要任务中,F1(0.5634)和ROUGE-1(0.4920)得分均有所提升,但在单只股票交易任务中未见改进,原因在于任务复杂性及模型能力限制。

ABSTRACT

The integration of Large Language Models (LLMs) into financial analysis has garnered significant attention in the NLP community. This paper presents our solution to IJCAI-2024 FinLLM challenge, investigating the capabilities of LLMs within three critical areas of financial tasks: financial classification, financial text summarization, and single stock trading. We adopted Llama3-8B and Mistral-7B as base models, fine-tuning them through Parameter Efficient Fine-Tuning (PEFT) and Low-Rank Adaptation (LoRA) approaches. To enhance model performance, we combine datasets from task 1 and task 2 for data fusion. Our approach aims to tackle these diverse tasks in a comprehensive and integrated manner, showcasing LLMs' capacity to address diverse and complex financial tasks with improved accuracy and decision-making capabilities.

研究动机与目标

  • 通过使用微调后的大型语言模型融合多任务数据,提升金融NLP性能。
  • 评估PEFT与LoRA在适应大型语言模型用于金融分类、摘要与交易任务中的有效性。
  • 探究将分类与摘要任务数据结合是否能增强金融大模型的推理与泛化能力。
  • 评估微调模型在复杂、序列化决策任务(如单只股票交易)中的可迁移性。
  • 识别7B/8B规模小型大模型在处理高风险金融预测任务中的局限性。

提出的方法

  • 使用LoRA与PEFT对Llama3-8B与Mistral-7B进行微调,实现参数高效的模型适配。
  • 将任务1(分类)与任务2(摘要)的训练数据进行融合,以增强模型泛化能力。
  • 采用ROUGE-1、ROUGE-2、BERTScore与F1作为摘要与分类任务的评估指标。
  • 通过四只股票的夏普比率、累计回报率与波动率评估交易性能。
  • 在FinMem框架中实现模型,从金融文本生成序列化交易决策。
  • 由于输出格式一致且性能稳定,最终选择在融合数据上微调的Mistral-7B进行测试。

实验结果

研究问题

  • RQ1金融分类与摘要任务之间的数据融合是否能提升大型语言模型在下游NLP任务中的表现?
  • RQ2在标注数据有限的情况下,PEFT与LoRA能否有效适应7B/8B规模的大型语言模型进行金融文本理解?
  • RQ3在组合数据集上进行微调是否能增强模型在多样化金融任务中的推理与泛化能力?
  • RQ4为何微调模型在更复杂的单只股票交易任务中未能提升性能?
  • RQ5模型规模与架构(如Mistral-7B与Llama3-8B)如何影响金融决策任务中的性能表现?

主要发现

  • Mistral-7B在分类与摘要任务中均优于Llama3-8B,表现出更优的输出结构与性能。
  • 在任务1中,融合数据微调的模型取得了0.5634的F1分数,显著优于单任务微调。
  • 在摘要任务中,融合模型的ROUGE-1得分为0.4920,表明摘要质量得到提升。
  • 在单只股票交易任务中,融合数据微调的模型未提升性能,测试集夏普比率为-0.6199。
  • 模型3(在任务1与任务2数据上联合训练)未超越仅在单一任务上训练的模型,表明融合数据可能引入噪声或冲突信号。
  • 所有模型在交易任务中表现欠佳,原因在于序列化决策的复杂性,以及7B/8B规模大模型在处理高风险金融预测任务时的能力局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。