[논문 리뷰] Financial Statement Analysis with Large Language Models
본 논문은 대형 언어 모델(GPT-4)이 익명화된 재무제표를 분석하고 향후 수익의 방향을 예측할 수 있으며, 인간 애널리스트를 능가하고 좁은 ML 모델과 대등하거나 더 우수한 성과를 보이며, 서술적 인사이트가 성능을 이끄는 주요 요인임을 보여준다.
We investigate whether large language models (LLMs) can successfully perform financial statement analysis in a way similar to a professional human analyst. We provide standardized and anonymous financial statements to GPT4 and instruct the model to analyze them to determine the direction of firms' future earnings. Even without narrative or industry-specific information, the LLM outperforms financial analysts in its ability to predict earnings changes directionally. The LLM exhibits a relative advantage over human analysts in situations when the analysts tend to struggle. Furthermore, we find that the prediction accuracy of the LLM is on par with a narrowly trained state-of-the-art ML model. LLM prediction does not stem from its training memory. Instead, we find that the LLM generates useful narrative insights about a company's future performance. Lastly, our trading strategies based on GPT's predictions yield a higher Sharpe ratio and alphas than strategies based on other models. Our results suggest that LLMs may take a central role in analysis and decision-making.
연구 동기 및 목표
- 대형 언어 모델이 숫자 데이터만 사용하여 전문가 분석가처럼 재무제표 분석을 수행할 수 있는지 평가한다.
- 수익 방향 예측에서 LLM의 성능을 인간 분석가 및 좁은 ML 모델(로지스틱 회귀 및 인공신경망)과 비교한다.
- 생각의 연쇄 프롬프팅(CoT)이 LLM 성능을 향상시키는지와 LLM의 서술이 가치를 더하는지 조사한다.
- 자산가격결정 및 거래 성과를 위한 LLM 예측의 경제적 유용성을 검토한다.
제안 방법
- 표준화되고 익명화된 대차대조표와 손익계정을 GPT-4 Turbo에 제공하되, 서술 텍스트를 동반하지 않는다.
- 두 가지 프롬프팅 방식: 간단한 프롬프트와 분석가의 추론을 모방하는 연쇄 사고(CoT) 프롬프트를 사용한다.
- IBES의 애널리스트 컨센서스 예측 및 5년 간의 롤링 외부 샘플 예측과 비교하여 예측을 평가한다.
- 같은 재무제표 데이터로 학습된 로지스틱 회귀와 인공 신경망에 대해 GPT-4 CoT 성능을 비교한다.
- 임베딩을 사용해 보조 예측기를 훈련시켜 GPT의 예측 서술이 향후 수익에 대한 정보를 포함하는지 분석한다.
실험 결과
연구 질문
- RQ1LLM이 숫자 재무제표 데이터만으로 경제적 통찰을 생성하고 서술 맥락 없이 수익의 방향을 예측할 수 있는가?
- RQ2수익 방향 예측에서 LLM의 성능이 인간 분석가 및 좁은 ML 모델과 어떻게 비교되는가?
- RQ3연쇄 사고 프롬프팅과 서술 생성이 LLM 예측을 향상시키는가? LLM 서술의 추가적 가치는 무엇인가?
- RQ4벤치마크에 비해 자산가격결정 및 거래전략에 대해 LLM 예측이 경제적으로 유용한가?
- RQ5모형의 학습 창을 넘어 샘플 외(out-of-sample)로 LLM 예측이 일반화되는가?
주요 결과
- 연쇄 사고(CoT) 프롬프트를 적용한 GPT-4는 연구에서 평균 애널리스트 벤치마크보다 높은 정확도(다음 해 수익 방향 예측에서 60%)를 달성했다.
- GPT-4의 정확성은 같은 데이터로 학습된 최첨단 인공신경망(ANN)과 비슷하거나 약간 더 높은 정확성을 보이며, GPT의 F1 점수는 더 높다.
- CoT 프롬 prompts가 생성한 서술은 임베딩 기반 모델에서 수익 방향을 예측하는 데 경쟁력 있는 정확도를 보이는 정보를 담고 있어, 이러한 인사이트가 성능을 좌우한다는 것을 시사한다.
- GPT 예측은 거래 관련성을 제공하며, GPT 예측을 바탕으로 한 롱쇼트 전략이 유의한 알파와 샤프비를 창출하고, 특히 소형주에서 두드러진다.
- 모델의 효과는 학습 데이터 기억 때문이 아니며, 2023년 데이터의 샘플 외 테스트가 학습 창을 넘어서는 성능을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.