[논문 리뷰] CFGPT: Chinese Financial Assistant with Large Language Model
CFGPT는 정제된 금융 데이터셋(CFData), 미세튜닝된 7B 파라미터 LLM(CFLLM), 실세계 적용 시스템(CFAPP)을 통합한 중국어 금융 대규모 언어 모델 프레임워크이다. 1410억 토큰의 전훈련과 150억 토큰의 지도 미세튜닝을 통해 여섯 가지 금융 작업에서 강력한 제로샷 및 패기샷 성능을 달성하였으며, 코드와 모델은 커뮤니티 사용을 위해 오픈소스로 공개되었다.
Large language models (LLMs) have demonstrated great potential in natural language processing tasks within the financial domain. In this work, we present a Chinese Financial Generative Pre-trained Transformer framework, named CFGPT, which includes a dataset~(CFData) for pre-training and supervised fine-tuning, a financial LLM~(CFLLM) to adeptly manage financial texts, and a deployment framework~(CFAPP) designed to navigate real-world financial applications. The CFData comprising both a pre-training dataset and a supervised fine-tuning dataset, where the pre-training dataset collates Chinese financial data and analytics, alongside a smaller subset of general-purpose text with 584M documents and 141B tokens in total, and the supervised fine-tuning dataset is tailored for six distinct financial tasks, embodying various facets of financial analysis and decision-making with 1.5M instruction pairs and 1.5B tokens in total. The CFLLM, which is based on InternLM-7B to balance the model capability and size, is trained on CFData in two stage, continued pre-training and supervised fine-tuning. The CFAPP is centered on large language models (LLMs) and augmented with additional modules to ensure multifaceted functionality in real-world application. Our codes are released at https://github.com/TongjiFinLab/CFGPT.
연구 동기 및 목표
- 중국어 금융 텍스트를 위한 도메인 특화 대규모 언어 모델의 부족을 해결하기 위해 전용 프레임워크를 개발한다.
- 금융 NLP 작업을 위한 전훈련 및 지도 미세튜닝 데이터를 통합한 종합적인 중국어 금융 데이터셋(CFData)을 구축한다.
- 이중 단계 훈련 방식인 계속 전훈련과 지도 미세튜닝을 사용하여 CFData 기반으로 금융 최적화 LLM(CFLLM)을 훈련시킨다.
- 다양한 입력 형식과 출력 유형을 지원하는 실세계 금융 응용 프로그램을 위한 실용적인 구현 프레임워크(CFAPP)를 설계한다.
- 연구 및 응용을 촉진하기 위해 코드와 모델을 오픈소스로 공개한다.
제안 방법
- 전훈련용 58400만 건의 문서(1410억 토큰)와 여섯 가지 금융 작업을 위한 150만 개의 지시 쌍(150억 토큰)을 포함하는 이원적 데이터셋인 CFData를 구축하였다.
- 성능과 효율성의 균형을 고려해 InternLM-7B를 기본 모델로 선택하여 금융 언어에 효과적으로 적응할 수 있도록 하였다.
- 이중 단계 훈련 방식을 적용: 먼저 금융 및 일반 중국어 코퍼스에서 계속 전훈련을 수행한 후, 작업별 지시 쌍을 사용한 지도 미세튜닝을 실시하였다.
- LLM 중심의 모듈식 구현 시스템으로 CFAPP를 설계하여 벡터 데이터베이스, 사고 체인 추론, 도메인 특화 모듈을 통합함으로써 응답 정확도와 신뢰성을 향상시켰다.
- 다양한 입력 형식(텍스트, 오디오, PDF)과 출력 형식(원시 텍스트, 템플릿, 머릿글리스트)을 지원하여 실세계 금융 환경에서의 사용성 향상을 도모하였다.
- InternLM-7B 외의 다른 LLM에의 확장성도 지원하여 프레임워크의 유연성을 높였다.
실험 결과
연구 질문
- RQ1정제된 중국어 금융 데이터셋 기반의 도메인 특화 대규모 언어 모델이 일반 목적의 LLM보다 금융 NLP 작업에서 뛰어난 성능을 내는가?
- RQ2계속 전훈련 이후 지도 미세튜닝을 포함하는 이중 단계 훈련 방식이 중국어 금융 텍스트 이해에서 제로샷 및 패기샷 능력을 향상시키는 데 얼마나 효과적인가?
- RQ3모듈식 구현 프레임워크(CFAPP)가 실세계 금융 응용에서 다양한 입력 형식과 출력 유형을 얼마나 잘 지원하는가?
- RQ4벡터 데이터베이스와 사고 체인 추론 모듈의 통합이 금융 LLM 응답의 사실적 정확도와 추론 능력을 얼마나 향상시키는가?
- RQ5도메인 특화 미세튜닝이 중국어 금융 환경에서 정서 분석, 사건 탐지, 주가 움직임 예측 등의 작업에 미치는 영향은 어떠한가?
주요 결과
- CFLLM-ins-7B 모델은 여섯 가지 금융 작업 전반에서 뛰어난 성능을 보이며, 도메인 특화 계속 전훈련과 지도 미세튜닝의 효과성을 입증하였다.
- CFData 데이터셋은 전훈련용 1410억 토큰과 미세튜닝용 150억 토큰을 포함하여 중국어 금융 LLM 훈련을 위한 종합적 자원을 제공한다.
- CFAPP 프레임워크는 다양한 입력 유형(텍스트, 오디오, PDF)과 출력 형식(원시 텍스트, 템플릿, 머릿글리스트)을 성공적으로 지원하여 실세계 적용 가능성 향상을 이룩하였다.
- 벡터 데이터베이스와 사고 체인 모듈의 통합은 금융 추론 작업에서 응답의 신뢰성과 사실 일관성을 향상시켰다.
- GitHub 통한 코드, 모델, 데이터셋의 오픈소스 공개는 중국어 금융 LLM 분야의 연구 및 혁신을 가속화할 것으로 기대된다.
- 초기 평가 결과, 특히 정서 분석, 요약, 금융 텍스트 기반 질문-답변 작업에서 제로샷 및 패기샷 설정에서의 모델 능력이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.