[논문 리뷰] Aligning LLMs with Human Instructions and Stock Market Feedback in Financial Sentiment Analysis
이 논문은 주식 시장 피드백에 대응해 지식 소스 가중치를 동적으로 조정하는 적응형 검색 증강 기반 LLM 프레임워크를 제안한다. 이를 통해 금융 감성 분석을 향상시킨다. 지시 훈련, RAG, 직접/강화학습 기반 가중치 최적화를 통해 LLaMA 2 모델을 미세조정한 결과, 정확도 및 F1 스코어가 1–6% 향상되었으며, 호황장에서 S&P 500보다 3.61% 높은 샤프 지수를 기록하는 감성 기반 포트폴리오를 생성하였다. 반대로 약세장에서는 최대 손실률을 5배 감소시켰다.
Financial sentiment analysis is crucial for trading and investment decision-making. This study introduces an adaptive retrieval augmented framework for Large Language Models (LLMs) that aligns with human instructions through Instruction Tuning and incorporates market feedback to dynamically adjust weights across various knowledge sources within the Retrieval-Augmented Generation (RAG) module. Building upon foundational models like LLaMA 2, we fine-tune a series of LLMs ranging from 7B to 70B in size, enriched with Instruction Tuning and RAG, and further optimized through direct feedback and Reinforcement Learning (RL)-based refinement methods applied to the source weights of RAG.Through extensive evaluation, we demonstrate that the sentiment outputs from our LLMs more accurately mirror the intrinsic sentiment of textual data, showcasing a 1% to 6% boost in accuracy and F1 score over existing state-of-the-art models and leading conversational AI systems. Moreover, the sentiments extracted are more indicative of the directions in stock price movements. On top of that, we successfully construct portfolios that yield a 3.61% higher Sharpe ratio compared to the S&P 500 baseline in bullish markets. These portfolios also demonstrate resilience in bearish markets, with a 5x reduction in return losses compared to those typically experienced by the S&P 500.
연구 동기 및 목표
- 실제 시장 피드백과 LLM을 정렬하여 감성 출력의 예측 정확도를 향상시키기 위해 금융 감성 분석을 향상시키는 것.
- 정적 RAG 가중치 설정의 한계를 해결하기 위해 지식 소스 기여도를 피드백 기반으로 동적으로 적응시키는 방법을 도입하는 것.
- 모델 규모(7B에서 70B 파라미터)가 금융 맥락에서 감성 분석 성능에 미치는 영향을 조사하는 것.
- 시장 수익률과 정렬된 감성 예측이 더 우수한 거래 신호와 포트폴리오 성과를 생성할 수 있는지 평가하는 것.
- 향후 작업에서 키워드 기반 검색에 대한 의존도를 줄이기 위해 의미적 검색 통합을 탐색하는 것.
제안 방법
- 프레임워크는 추론 중에 LLM의 맥락을 풍부하게 하기 위해 다수의 외부 지식 소스를 활용하는 검색 증강 생성(RAG)을 적용한다.
- RAG 내 지식 소스 가중치는 후속 주가 움직임을 기반으로 직접 피드백 또는 강화학습(RL)을 통해 동적으로 조정된다.
- 7B에서 70B 파라미터에 이르기까지 다양한 크기의 대규모 언어 모델(LLaMA 2 변종)을 지시 훈련 및 RAG를 통해 미세조정하여 금융 감성 이해를 향상시킨다.
- 시장 피드백은 RAG 가중치를 개선하기 위한 보상 신호로 사용되며, 감성 예측의 향상을 위한 장기 피드백 루프를 형성한다.
- 시스템은 감성 출력을 실제 시장 수익률과 비교하여 정보 소스의 가중치를 반복적으로 최적화한다.
- 향후 통합을 위해 의미적 검색 기능을 제안하여 키워드 기반 검색을 대체하고 검색의 관련성을 향상시키고자 한다.
실험 결과
연구 질문
- RQ1실제 시장 피드백에 기반해 다수의 지식 소스에 대해 비균일한 가중치를 동적으로 조정할 수 있는 LLM의 RAG 모듈을 어떻게 향상시킬 수 있는가?
- RQ2모델 규모 증가가 금융 감성 분석에서 LLM 성능에 어떤 영향을 미치는가?
- RQ3시장 피드백과 정렬된 LLM은 향후 주가 움직임을 더 정확하게 반영하는 감성 예측을 생성하는가?
- RQ4직접 피드백과 RL 기반 가중치 최적화는 금융 감성 작업의 RAG 성능을 최적화하는 데 어떻게 비교되는가?
- RQ5시장 피드백에 맞춰 정렬된 LLM의 감성 출력은 측정 가능한 리스크 조정 수익률을 기록하는 뛰어난 거래 전략을 생성할 수 있는가?
주요 결과
- LLaMA I-RAG-RL 모델은 호황장에서 샤프 지수 2.3557을 기록하여 S&P 500 기준선(2.2736) 대비 3.61% 향상된 성과를 보였다.
- 모든 LLM 포트폴리오가 호황장에서 누적 수익률 면에서 S&P 500 기준선을 초월했으며, 가장 고도화된 모델이 가장 뛰어난 리스크 조정 수익률을 기록했다.
- 약세장(2022년)에서는 LLM 포트폴리오가 S&P 500 대비 최대 손실률을 5배 감소시켜 시장 하락장에서의 회복력을 입증했다.
- 최적화된 모델의 감성 출력은 최첨단 모델과 주요 대화형 AI 시스템 대비 정확도 및 F1 스코어에서 1%에서 6% 향상된 성과를 보였다.
- RAG 가중치 최적화를 위한 직접 피드백 방법은 매우 효과적이었으며, 특히 변동성이 높은 조건에서 강화학습 기반 최적화가 성능을 추가로 향상시켰다.
- 최적화된 LLM에서 유도된 감성 예측은 다음 날 주가 움직임을 더 예측 가능하게 했으며, 시장에 맞춘 개선 방식의 가치를 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.