Skip to main content
QUICK REVIEW

[논문 리뷰] CatMemo at the FinLLM Challenge Task: Fine-Tuning Large Language Models using Data Fusion in Financial Applications

Yupeng Cao, Zhiyuan Yao|arXiv (Cornell University)|2024. 07. 02.
Stock Market Forecasting MethodsDecision Sciences인용 수 3
한 줄 요약

이 논문은 재무 NLP 작업에서 성능을 향상시키기 위해 Parameter-Efficient Fine-Tuning (PEFT) 및 LoRA를 사용하여 Llama3-8B와 Mistral-7B를 피팅하기 위한 데이터 융합 접근법을 제시한다. 분류 및 요약 작업에서 F1(0.5634)과 ROUGE-1(0.4920) 점수 향상을 달성했지만, 작업의 복잡성과 모델 한계로 인해 단일 주식 거래 작업에서는 향상이 없었다.

ABSTRACT

The integration of Large Language Models (LLMs) into financial analysis has garnered significant attention in the NLP community. This paper presents our solution to IJCAI-2024 FinLLM challenge, investigating the capabilities of LLMs within three critical areas of financial tasks: financial classification, financial text summarization, and single stock trading. We adopted Llama3-8B and Mistral-7B as base models, fine-tuning them through Parameter Efficient Fine-Tuning (PEFT) and Low-Rank Adaptation (LoRA) approaches. To enhance model performance, we combine datasets from task 1 and task 2 for data fusion. Our approach aims to tackle these diverse tasks in a comprehensive and integrated manner, showcasing LLMs' capacity to address diverse and complex financial tasks with improved accuracy and decision-making capabilities.

연구 동기 및 목표

  • 다양한 작업의 데이터셋을 융합하여 미세조정된 LLM을 통해 재무 NLP 성능을 향상시키기 위해.
  • PEFT 및 LoRA가 재무 분류, 요약, 거래 작업에 적응시키는 데 효과적인지 평가하기 위해.
  • 분류 및 요약 작업에서의 데이터를 융합함으로써 재무 LLM의 추론 능력과 일반화 능력 향상 여부를 조사하기 위해.
  • 미세조정된 모델이 단일 주식 거래와 같은 복잡한 순차적 의사결정 작업으로의 이식 가능성 평가하기 위해.
  • 작은 LLM(7B/8B)이 고위험 재무 예측 작업을 처리하는 데에 한계를 보이는지 규명하기 위해.

제안 방법

  • LoRA 및 PEFT를 사용하여 Llama3-8B와 Mistral-7B를 파rameter 효율적으로 적응시키기 위해 미세조정하였다.
  • 작업 1(분류)과 작업 2(요약)의 훈련 데이터를 융합하여 모델의 일반화 능력을 향상시켰다.
  • 요약 및 분류 작업 평가에 ROUGE-1, ROUGE-2, BERTScore 및 F1을 평가 지표로 사용하였다.
  • 네 종목에 대해 단일 주식 거래 성능을 샤프 비율, 누적 수익률 및 변동성으로 평가하였다.
  • 재무 텍스트에서 순차적 거래 결정을 생성하기 위해 FinMem 프레임워크에 모델을 구현하였다.
  • 일관된 출력 형식과 성능로 인해 최종 테스트를 위해 데이터 융합에 대해 미세조정된 Mistral-7B를 선택하였다.

실험 결과

연구 질문

  • RQ1재무 분류 및 요약 작업 간의 데이터 융합이 하류 NLP 작업에서 LLM 성능 향상에 기여하는가?
  • RQ2PEFT 및 LoRA가 제한된 레이블 데이터로 7B/8B LLM을 재무 텍스트 이해에 효과적으로 적응시킬 수 있는가?
  • RQ3통합된 데이터셋으로의 미세조정이 다양한 재무 작업 간의 추론 및 일반화 능력을 향상시키는가?
  • RQ4왜 미세조정된 모델은 더 복잡한 단일 주식 거래 작업에서 성능 향상을 이룰 수 없었는가?
  • RQ5모델 크기와 아키텍처(예: Mistral-7B 대 Llama3-8B)가 재무 의사결정 작업 성능에 어떤 영향을 미치는가?

주요 결과

  • Mistral-7B는 분류 및 요약 작업 모두에서 Llama3-8B를 능가했으며, 더 나은 출력 구조와 성능를 보였다.
  • 융합 데이터로 미세조정된 모델은 작업 1에서 F1 점수 0.5634를 기록하여 단일 작업 미세조정 대비 뚜렷한 향상을 보였다.
  • 요약 작업에서 융합 모델은 ROUGE-1 점수 0.4920을 기록하여 요약 품질 향상을 보였다.
  • 융합 데이터로 미세조정된 모델는 단일 주식 거래 작업에서 성능 향상을 이룰 수 없었으며, 테스트 세트에서 샤프 비율 -0.6199를 기록했다.
  • 작업 1과 작업 2 데이터를 모두 학습한 모델 3은 개별 작업에 대해 훈련된 모델보다 성능이 떨어지지 않았다. 이는 융합된 데이터에서 잡음 또는 상충되는 신호가 존재할 수 있음을 시사한다.
  • 모든 모델이 거래 작업에서 성능이 열악했으며, 이는 순차적 의사결정의 복잡성과 7B/8B LLM이 고위험 재무 예측을 처리하는 데에 한계를 보이기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.