[논문 리뷰] Integrating Stock Features and Global Information via Large Language Models for Enhanced Stock Return Prediction
이 논문은 중국 A주식 시장에서 주가 수익률 예측을 향상시키기 위해 대규모 언어 모델(Large Language Models, LLMs)을 활용해 주식 특징과 글로벌 정보를 통합하는 새로운 프레임워크인 SCRL-LG를 제안한다. 지역-글로벌 모델을 통해 수익률을 분해하고, 자기상관 강화학습(Self-Correlated Reinforcement Learning)을 통해 LLM이 생성한 뉴스 임베딩을 정량적 주식 특징과 동일한 의미 공간에 정렬함으로써, 순위 정보 계수와 비정상 수익률 측면에서 뛰어난 성능을 달성한다. 특히 장기 보유 기간 동안 두드러진 성능 향상을 보인다.
The remarkable achievements and rapid advancements of Large Language Models (LLMs) such as ChatGPT and GPT-4 have showcased their immense potential in quantitative investment. Traders can effectively leverage these LLMs to analyze financial news and predict stock returns accurately. However, integrating LLMs into existing quantitative models presents two primary challenges: the insufficient utilization of semantic information embedded within LLMs and the difficulties in aligning the latent information within LLMs with pre-existing quantitative stock features. We propose a novel framework consisting of two components to surmount these challenges. The first component, the Local-Global (LG) model, introduces three distinct strategies for modeling global information. These approaches are grounded respectively on stock features, the capabilities of LLMs, and a hybrid method combining the two paradigms. The second component, Self-Correlated Reinforcement Learning (SCRL), focuses on aligning the embeddings of financial news generated by LLMs with stock features within the same semantic space. By implementing our framework, we have demonstrated superior performance in Rank Information Coefficient and returns, particularly compared to models relying only on stock features in the China A-share market.
연구 동기 및 목표
- LLMs에서 의미 지식을 주가 수익률 예측에 적절히 활용하지 못하는 문제를 해결하기 위해.
- 다른 의미 공간에 존재하는 LLM이 생성한 뉴스 임베딩과 정량적 주식 특징 간의 정렬 불일치 문제를 해결하기 위해.
- 통합된 프레임워크를 통해 지역(주식 특화) 및 글로벌(시장, 산업, 정책) 정보를 통합함으로써 예측 성능을 향상시키기 위해.
- 감성 분석를 넘어서 다중 모odal 주가 수익률 예측에서 LLM의 효과성을 입증하기 위해.
제안 방법
- 지역-글로벌(LG) 모델은 주가 수익률을 볼륨 및 가격 특징에서 유래한 지역 성분(α)과 시장, 산업, 정책 정보에서 유래한 글로벌 성분(β)으로 분해한다.
- 세 가지 글로벌 모델링 전략이 도입된다: (1) 주식 특징 기반, (2) LLM 네이티브, (3) 하이브리드로, 글로벌 맥락의 탄력적 통합을 가능하게 한다.
- 자기상관 강화학습(SCRL)은 대비 학습 목표를 통해 LLM이 생성한 뉴스 임베딩을 정량적 주식 특징과 동일한 의미 공간에 정렬한다.
- 프레임워크는 순위 손실과 대비 손실을 통합한 공동 손실 함수를 사용하여 정렬과 예측 정확도를 최적화한다.
- 2022년 중국 A주식 데이터를 대상으로 백테스트를 수행하여 다양한 보유 기간 동안 성능을 평가한다.
- 모델은 감성 외에도 뉴스 헤드라인에서 풍부한 의미 표현을 추출하기 위해 LLM을 활용한다.
실험 결과
연구 질문
- RQ1LLMs는 감성 분석를 넘어서 주가 수익률 예측을 위한 종합적 의미 지식을 추출하는 데 효과적으로 활용될 수 있는가?
- RQ2LLM에서 생성된 임베딩과 정량적 주식 특징이 동일한 의미 공간에 정렬될 경우 예측 성능 향상에 기여하는가?
- RQ3LLMs를 통해 시장, 산업, 정책 정보를 통합함으로써 장기 수익률 예측에서의 성능 저하를 완화할 수 있는가?
- RQ4SCRL-LG 프레임워크는 주로 주식 특징에 의존하는 모델에 비해 순위 정보 계수와 비정상 수익률 측면에서 어떻게 비교되는가?
주요 결과
- SCRL-LG 모델은 중국 A주식 데이터에서 단순 주식 특징만을 사용하는 모델에 비해 순위 정보 계수와 비정상 수익률 측면에서 뚜렷한 승리를 거두었다.
- 예측 수평이 증가함에 따라 성능이 유지되거나 향상되었으며, 지역 모델만을 사용한 경우 연간 수익률과 샤프 비율이 뚜렷이 감소함을 확인하였다.
- LG-LLM 및 LG-STOCK 변종은 장기 보유 기간 동안 뛰어난 내구성을 보였으며, 성능 저하가 최소한이었다.
- SCRL-LG 모델는 성능 향상과 함께 전환율이 감소하는 경향을 보이며, 효율적이고 안정적인 거래 신호를 제공함을 시사한다.
- 주식 특징과 LLM을 조합한 하이브리드 글로벌 모델링 전략이 시장, 산업, 기업 수준의 영향을 다수 수준에서 효과적으로 포착하는 데 가장 효과적이었다.
- LLM이 생성한 임베딩을 주식 특징과 통합된 의미 공간에 정렬함으로써 예측 정확도가 향상됨을 프레임워크가 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.