Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting The Stock Trend Using News Sentiment Analysis and Technical Indicators in Spark

Taylan Kabbani, Fatih Enes Usta|arXiv (Cornell University)|2022. 01. 19.
Stock Market Forecasting MethodsDecision Sciences인용 수 18
한 줄 요약

이 논문은 스파크를 사용하여 기술적 지표와 뉴스 감성 점수를 결합하여 이진 분류(상승장/하락장)를 위한 하이브리드 주가 추세 예측 모델을 제안한다. S&P 500 주식(AAPL, AMZN, NFLX)에 대해 로지스틱 회귀, 랜덤 포레스트, 기울기 부스팅 머신을 적용하여 랜덤 포레스트가 최고의 성능을 보이며 테스트 정확도 63.58%를 달성한다.

ABSTRACT

Predicting the stock market trend has always been challenging since its movement is affected by many factors. Here, we approach the future trend prediction problem as a machine learning classification problem by creating tomorrow_trend feature as our label to be predicted. Different features are given to help the machine learning model predict the label of a given day; whether it is an uptrend or downtrend, those features are technical indicators generated from the stock's price history. In addition, as financial news plays a vital role in changing the investor's behavior, the overall sentiment score on a given day is created from all news released on that day and added to the model as another feature. Three different machine learning models are tested in Spark (big-data computing platform), Logistic Regression, Random Forest, and Gradient Boosting Machine. Random Forest was the best performing model with a 63.58% test accuracy.

연구 동기 및 목표

  • 빅데이터 플랫폼을 활용하여 기술적 지표와 금융 뉴스 감성 정보를 통합함으로써 주가 추세 예측 정확도를 향상시키기 위해.
  • 스케일러블 기계학습 파이프라인에서 기본적(뉴스 감성) 및 기술적(가격 기반 지표) 분석을 결합하는 효과성을 평가하기 위해.
  • 스파크를 사용하여 주가 추세 분류에 대해 다수의 기계학습 모델(로지스틱 회귀, 랜덤 포레스트, 기울기 부스팅 머신)의 성능을 평가하기 위해.
  • Apache 스파크의 MLlib 프레임워크에서의 병렬 실행을 통해 학습 시간을 단축하고 하이퍼파rameter 튜닝을 향상시키기 위해.

제안 방법

  • 매일의 주가 가격 데이터(시가, 고가, 저가, 종가, 거래량, 정규 종가)를 수집하고 SMA, RSI, MACD, 볼린저 밴드를 포함한 10개의 기술적 지표를 계산하였다.
  • 2016~2020년 기간 동안 9.2GB의 금융 뉴스 기사 데이터를 확보하고, BERT 기반 NLP 모델을 사용하여 평균 풀드 문장 임베딩을 통해 매일의 감성 점수를 추출하였다.
  • 같은 날에 발표된 모든 뉴스 기사를 그룹화하여 거래일 단위로 총합 감성 점수를 계산하였다.
  • 각 주식당 9개의 변수로 구성된 최종 특징 집합을 구성하였다: 6개의 기술적 지표(SMA, RSI, MACD, 볼린저 밴드, OBV, 슈티스틱 오실레이터), 거래량, 및 집계된 일일 감성 점수.
  • MinMaxScaler를 사용한 특징 정규화, RFormula를 통한 범주형 레이블의 원핫 인코딩, 그리고 그리드 서치를 통한 하이퍼파rameter 튜닝을 위한 10겹 교차검증을 포함한 스파크 ML 파이프라인을 적용하였다.
  • 정확도, 정밀도, 재현율, F1 점수를 평가 지표로 사용하여, 80% 학습 세트와 20% 테스트 세트로 나누어 로지스틱 회귀, 랜덤 포레스트, 기울기 부스팅 머신 세 가지 분류기 모델을 학습하고 평가하였다.

실험 결과

연구 질문

  • RQ1가격 데이터만을 사용하는 것과 비교해 기술적 지표와 뉴스 감성 점수를 결합함으로써 주가 추세 예측 정확도가 향상되는가?
  • RQ2하이브리드 금융 및 감성 특징을 기반으로 훈련된 경우, 다양한 기계학습 모델(로지스틱 회귀, 랜덤 포레스트, 기울기 부스팅 머신)이 주가 추세 방향(상승장/하락장) 분류에 대해 어떻게 성능을 내는가?
  • RQ3Apache 스파크를 사용함으로써 대규모 금융 데이터 세트에 대한 주가 예측 모델의 확장성과 학습 효율성이 얼마나 향상되는가?
  • RQ4특징 상관관계가 모델 성능에 미치는 영향은 무엇이며, 비중복 특징만 유지하는 특징 선택(예: 중복되지 않은 특징 유지)이 예측 정확도에 어떤 영향을 미치는가?

주요 결과

  • 랜덤 포레스트가 모든 세 주식(AAPL, AMZN, NFLX)에서 가장 높은 테스트 정확도 63.58%를 기록하여 로지스틱 회귀 및 기울기 부스팅 머신을 모두 앞섰다.
  • 학습 정확도가 65.5%로 약간의 과적합이 있었지만, 독립된 테스트 세트에서 강력한 성능 유지를 보였다.
  • 특징 상관관계 분석 결과, 시가, 고가, 저가, 종가, 정규 종가, SMA 등 가격 기반 특징 간에 높은 상관관계가 확인되어 중복을 줄이기 위해 SMA, 고가, 종가만 유지하였다.
  • BERT 기반 NLP를 활용한 감성 분석은 금융 뉴스에서 맥락 인식 감성 점수를 제공하였으며, 이는 성공적으로 예측 특징으로 통합되었다.
  • 스파크 기반 파이프라인은 효율적인 병렬 처리를 가능하게 하여 학습 시간을 크게 단축하였고, 대규모 그리드 구성에서의 광범위한 하이퍼파rameter 튜닝을 지원하였다.
  • 모델의 정확도가 중간 정도였지만, 결과적으로 변동성이 큰 시장에서 뉴스 감성과 기술적 지표를 통합하는 것이 의미 있는 예측 신호를 제공할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.