Skip to main content
QUICK REVIEW

[논문 리뷰] Data-Centric Financial Large Language Models

Zhixuan Chu, Huaiyu Guo|arXiv (Cornell University)|2023. 10. 07.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 다중 작업 프롬프트 기반 미세조정을 통해 재무 분석을 위한 전문화된 대규모 언어 모델(FLLM)을 훈련시켜 재무 텍스트를 사전 처리하고 사전 이해함으로써 일반 대규모 언어 모델(LLM)의 성능을 햖थ기 위한 데이터 중심적 접근을 제안한다. 라벨이 부족한 문제를 해결하기 위해, FLLM의 자체 의사 레이블에서 고품질의 훈련 예제를 자동으로 생성하는 추론 기반 보완(AAR) 기법을 도입하여 재무 해석 벤치마크에서 최신 기술 성능을 달성하고, 새로운 오픈소스 벤치마크를 공개한다.

ABSTRACT

Large language models (LLMs) show promise for natural language tasks but struggle when applied directly to complex domains like finance. LLMs have difficulty reasoning about and integrating all relevant information. We propose a data-centric approach to enable LLMs to better handle financial tasks. Our key insight is that rather than overloading the LLM with everything at once, it is more effective to preprocess and pre-understand the data. We create a financial LLM (FLLM) using multitask prompt-based finetuning to achieve data pre-processing and pre-understanding. However, labeled data is scarce for each task. To overcome manual annotation costs, we employ abductive augmentation reasoning (AAR) to automatically generate training data by modifying the pseudo labels from FLLM's own outputs. Experiments show our data-centric FLLM with AAR substantially outperforms baseline financial LLMs designed for raw text, achieving state-of-the-art on financial analysis and interpretation tasks. We also open source a new benchmark for financial analysis and interpretation. Our methodology provides a promising path to unlock LLMs' potential for complex real-world domains.

연구 동기 및 목표

  • 일반 목적의 LLM을 복잡한 재무 작업에 적용하는 데 직면한 과제를 해결하기 위해, 정보 과부하와 도메인 통합 부족으로 인해 원시 텍스트에 대한 직접적 추론이 실패하는 이유를 해결한다.
  • 전문가가 레이블링한 재무 데이터의 부족 문제를 해결하기 위해 수동 레이블링이 아닌 자기지도 추론을 통한 데이터 합성 자동화를 통해 해결한다.
  • 다중 작업 미세조정을 통해 재무 텍스트를 사전 처리하고 구조화하여 재무 LLM의 추론 및 해석 능력을 향상시킨다.
  • FLLM를 강화한 프롬프팅이 기존 LLM 에이전트(예: LangChain)가 정확하고 논리적이며 전문가 수준의 재무 분석을 생성하는 데에 얼마나 기여하는지 평가한다.
  • 도메인 표준화를 위해 재무 분석 및 해석을 위한 새로운 벤치마크를 구축한다.

제안 방법

  • 다양한 재무 NLP 작업(이벤트 매칭, 시각 평가, 핵심 포인트 추출 등)에 대해 다중 작업 프롬프트 기반 미세조정을 통해 재무 전용 LLM(FLLM)을 훈련한다.
  • FLLM의 자체 출력 결과를 의사 레이블로 사용하여 추론 기반 보완(AAR)을 통해 합성 훈련 데이터를 생성하며, 출력을 수정하여 다양한 고품질의 훈련 예제를 생성한다.
  • FLLM를 프리프로세서로 활용하여 ChatGPT와 같은 후행 LLM에 입력하기 전에 원시 재무 텍스트를 도메인 이해 기반의 구조화된 표현으로 변환한다.
  • FLLM 출력 결과를 LangChain 프롬프트에 통합하여 생성 과정을 이끌어내어 재무 해석의 관련성, 정확도, 논리성 및 전문성 향상을 도모한다.
  • 컨텍스트 기반 학습과 프롬프트 엔지니어링을 활용하여 FLLM을 완전한 재훈련 없이도 새로운 재무 작업에 대해 제로샷 및 희소샷 적응이 가능하게 한다.
  • 재무 분석 및 해석을 위한 새로운 오픈소스 벤치마크를 공개하여 평가의 표준화와 재현 가능성 향상을 도모한다.

실험 결과

연구 질문

  • RQ1표준 텍스트 미세조정 대비 데이터 중심 접근이 재무 분석 및 해석 작업에서 LLM의 성능을 크게 향상시킬 수 있는가?
  • RQ2추론 기반 보완(AAR)이 재무 NLP에서 비용이 많이 드는 전문가 레이블링 데이터에 대한 의존도를 어느 정도 감소시킬 수 있는가?
  • RQ3FLLM를 강화한 프롬프팅이 기존 LLM 에이전트(예: LangChain)가 생성하는 재무 분석의 품질을 얼마나 향상시키는가?
  • RQ4이벤트 매칭, 시각 평가, 핵심 포인트 추출 등의 FLLM 하위 작업 중 각각의 기여도는 어떻게 다른가?
  • RQ5제안된 FLLM 프레임워크는 금융 외의 복잡하고 지식 집약적인 도메인으로 일반화될 수 있는가?

주요 결과

  • 추론 기반 보완(AAR)을 적용한 FLLM는 재무 분석 및 해석 벤치마크에서 기존의 원시 텍스트 기반 미세조정된 LLM을 능가하는 최신 기술 성능을 달성한다.
  • FLLM를 강화한 LangChain 출력 결과는 모든 평가 차원에서 유의미하게 높은 점수를 기록했다: 관련성(4.85 vs. 4.28), 정확도(4.78 vs. 4.14), 논리성(4.28 vs. 3.71), 전문성(4.71 vs. 3.57).
  • 절단 실험 결과, 이벤트 매칭, 시각 평가, 핵심 포인트 추출의 세 하위 작업 모두 최종 출력 품질 향상에 독립적이고 상호 보완적인 기여를 한다.
  • FLLM의 성능은 레이블 데이터의 양이 증가할수록 향상되며, 제한된 감독 하에서도 확장 가능하고 효과적임을 입증한다.
  • 제안된 재무 분석 및 해석을 위한 벤치마크는 표준화된 인간 레이블링 평가 세트를 제공하여 향후 모델 간 신뢰성 있는 비교를 가능하게 한다.
  • 이 프레임워크는 도메인 전용 LLM을 통해 재무 데이터의 사전 처리 및 사전 이해를 수행함으로써, 조그만 레이블 데이터만으로도 후행 추론 능력을 크게 향상시킬 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.