Skip to main content
QUICK REVIEW

[논문 리뷰] CFBenchmark: Chinese Financial Assistant Benchmark for Large Language Model

Lei Yang, Jiangtong Li|arXiv (Cornell University)|2023. 11. 10.
Topic Modeling인용 수 5
한 줄 요약

CFBenchmark는 중국어 금융 대규모 언어 모델(Large Language Models, LLMs)의 재정 인식, 분류, 생성이라는 세 가지 核 心 능력에 대해 종합적인 벤치마크를 제공한다. 이 벤치마크는 8개의 작업을 포함한 총 3,917건의 중국어 금융 텍스트를 바탕으로 22개의 LLM을 평가하며, 일부 모델이 특정 작업에서 뛰어난 성능을 보이지만 전반적으로 모든 작업에서 뛰어난 성능을 내는 모델는 없음을 확인하여 금융 텍스트 처리 능력 향상에 여전히 큰 여유가 있음을 시사한다.

ABSTRACT

Large language models (LLMs) have demonstrated great potential in the financial domain. Thus, it becomes important to assess the performance of LLMs in the financial tasks. In this work, we introduce CFBenchmark, to evaluate the performance of LLMs for Chinese financial assistant. The basic version of CFBenchmark is designed to evaluate the basic ability in Chinese financial text processing from three aspects~(\emph{i.e.} recognition, classification, and generation) including eight tasks, and includes financial texts ranging in length from 50 to over 1,800 characters. We conduct experiments on several LLMs available in the literature with CFBenchmark-Basic, and the experimental results indicate that while some LLMs show outstanding performance in specific tasks, overall, there is still significant room for improvement in basic tasks of financial text processing with existing models. In the future, we plan to explore the advanced version of CFBenchmark, aiming to further explore the extensive capabilities of language models in more profound dimensions as a financial assistant in Chinese. Our codes are released at https://github.com/TongjiFinLab/CFBenchmark.

연구 동기 및 목표

  • 중국어 금융 LLM 평가를 위한 도메인 특화 벤치마크 부족 문제를 해결하기 위해.
  • 중국어에서의 기본적인 금융 텍스트 처리 작업을 종합적으로 평가할 수 있는 벤치마크를 설계하기 위해.
  • 실제 중국어 금융 텍스트 데이터를 처리할 때 기존 LLM의 성능 격차를 규명하기 위해.
  • 구조화된 평가 프레임워크를 통해 향후 고급 금융 AI 어시스턴트 개발의 기반을 마련하기 위해.
  • 일반 모델 대비 도메인 적응형 미세조정의 효과를 비교를 통해 입증하기 위해.

제안 방법

  • CFBenchmark-Basic는 길이가 50자에서 1,800자 이상인 고품질 중국어 금융 텍스트 총 3,917건으로 구성되어 있다.
  • 벤치마크는 재정 인식(기업 및 제품), 분류(감성, 산업 부문, 사건), 생성(요약, 툈자 추천, 리스크 경고)의 세 가지 주요 평가 영역으로 구성되어 있다.
  • 각 작업은 인간 검증 레이블을 통해 데이터 품질과 실제 적용의 일치성을 확보하기 위해 제공된다.
  • 22개의 사전 학습 및 미세조정된 LLM을 대상으로 제로샷 및 피셔샷 설정에서 실험을 수행한다.
  • 성능 평가에는 F1 점수 및 정확도와 같은 표준 지표를 사용하며, 결과는 작업 및 모델 유형별로 집계된다.
  • 도메인 특화 모델인 CFGPT1-sft-7B-LoRA는 일반 다국어 및 双어 모델과 비교하여 도메인 적응형 미세조정의 영향을 평가하기 위해 훈련 및 평가된다.

실험 결과

연구 질문

  • RQ1기존 LLM은 기본적인 중국어 금융 텍스트 처리 작업에서 얼마나 잘 수행하는가?
  • RQ2현재 LLM에서 재정 인식, 분류, 생성 능력 간의 성능 격차는 무엇인가?
  • RQ3일반 모델 대비 도메인 특화 미세조정은 금융 작업에서 LLM 성능에 어떤 영향을 미치는가?
  • RQ4일부 모델은 전체적인 능력이 뛰어나도 특정 작업에서 성능이 떨어지는 이유는 무엇인가?
  • RQ5다국어 모델은 단일 언어 중국어 모델 대비 금융 텍스트 이해에서 얼마나 떨어지는가?

주요 결과

  • 공개된 LLM 중에서 재정 인식, 분류, 생성의 세 주요 평가 영역 전반에서 F1 점수 0.6을 초과하는 모델는 존재하지 않으며, 이는 향후 성능 향상 여유가 크다는 것을 시사한다.
  • ERNIE-Bot-4는 재정 인식에서 최고 점수 0.618을 기록했고, InternLM-20B는 재정 생성에서 0.695로 선두를 달렸다.
  • Baichuan2-13B-Chat는 콘텐츠 생성에서 최고 점수 0.706을 기록했지만, 특히 리스크 경고 생성에서 일반적이고 반복적인 응답을 보여, 질적 측면에서 한계를 드러냈다.
  • Falcon 및 BLOOMZ와 같은 다국어 모델은 유사한 크기의 双어 중국어-영어 모델보다 성능이 열 劣했으며, 이는 금융 작업에서 언어 특화 사전 훈련의 중요성을 강조한다.
  • CFGPT1-sft-7B-LoRA와 같은 도메인 적응형 모델은 일반 모델 및 전체 파rameter 버전 대비 뛰어난 성능을 보이며, 금융 데이터 기반의 미세조정이 효과적임을 입증했다.
  • 파라미터 수가 많을수록 일반적으로 성능이 뛰어나며, 특히 정보 추출 작업에서 두드러졌다. 이는 복잡한 금융 데이터 처리를 위해 능력 확보가 필수적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.