Skip to main content
QUICK REVIEW

[논문 리뷰] Stock Market Prediction from WSJ: Text Mining via Sparse Matrix Factorization

Felix Ming Fai Wong, Zhenming Liu|arXiv (Cornell University)|2014. 06. 27.
Stock Market Forecasting Methods참고 문헌 18인용 수 8
한 줄 요약

이 논문은 주식 가격 움직임과 월스트리트저널(WSJ) 뉴스 기사 간의 상관관계를 공통의 저차원 잠재 공간에서 통합적으로 모델링하는 스파스 행렬 분해 모델을 제안한다. 이는 언론에 언급되지 않은 주식까지 포함해 S&P 500 주식의 주가 방향을 정확하게 예측할 수 있게 하며, 백테스트 거래 전략에서 55.7%의 정확도를 달성하고, 수익률과 샤프 지수 모두에서 벤치마크를 능가한다.

ABSTRACT

We revisit the problem of predicting directional movements of stock prices based on news articles: here our algorithm uses daily articles from The Wall Street Journal to predict the closing stock prices on the same day. We propose a unified latent space model to characterize the "co-movements" between stock prices and news articles. Unlike many existing approaches, our new model is able to simultaneously leverage the correlations: (a) among stock prices, (b) among news articles, and (c) between stock prices and news articles. Thus, our model is able to make daily predictions on more than 500 stocks (most of which are not even mentioned in any news article) while having low complexity. We carry out extensive backtesting on trading strategies based on our algorithm. The result shows that our model has substantially better accuracy rate (55.7%) compared to many widely used algorithms. The return (56%) and Sharpe ratio due to a trading strategy based on our model are also much higher than baseline indices.

연구 동기 및 목표

  • 매일의 WSJ 뉴스 기사와 종가 데이터만을 사용하여 명시적 개체 인식이나 감성 분석에 의존하지 않고 주가 방향을 예측하는 데 도전하는 것.
  • 주가 공동 움직임, 뉴스 기사 내용, 그리고 이들의 상관관계를 통합된 잠재 공간에서 공동으로 모델링하는 것.
  • 언론에 직접적으로 언급되지 않은 주식까지도 포함해 주요 인덱스에 속한 500개 이상의 주식에 대해 정확한 예측을 가능하게 하면서도, 낮은 모델 복잡도를 유지하는 것.
  • 제한된 훈련 데이터(6년간 약 1500개의 거래일)에도 불구하고 잘 작동하는 강건하고 데이터 효율적인 방법을 개발하는 것.
  • 효율적 시장 가정 하에서도 뉴스 및 가격 데이터의 잠재적 구조가 수익성 있는 거래 전략을 도출할 수 있음을 입증하는 것.

제안 방법

  • 주가와 뉴스 기사를 스파스 행렬 분해를 통해 공통의 저차원 잠재 공간에 임bedding하는 통합 잠재 요인 모델을 수립한다.
  • 주로 산술적 주제(예: 에너지, 정치 등)를 나타내는 잠재 요인을 추출하기 위해 특이값 분해(SVD)를 모방한 분해 기법을 사용한다.
  • 비볼록 최적화 문제를 행렬 변수로 해결하기 위해 교차 방법 다중 승수(ADMM)를 적용하여 정규화 및 과적합 방지를 제어한다.
  • 훈련 일수(6년간 약 1500일)에 비해 고차원성을 다루기 위해 요인 행렬에 스파arsity 제약 조건을 도입한다.
  • 감성 분석이나 명시적 개체 인식과 같은 자연어 처리(NLP) 기법을 회피하고, 텍스트와 가격 데이터의 동시 발생 패atters에만 의존한다.
  • 뉴스 기사와 주가가 공통의 잠재 주제를 따라 공변동한다는 가정을 활용하여, 알려지지 않은 주식에 대해서도 추론이 가능하도록 한다.

실험 결과

연구 질문

  • RQ1통합 잠재 공간 모델이 주가 움직임, 뉴스 기사 내용, 그리고 이들의 상관관계를 효과적으로 포착하고 예측에 활용할 수 있는가?
  • RQ2시장 전체의 잠재적 상관관계를 활용할 경우, 언론에 언급되지 않은 주식의 주가 방향을 얼마나 정확하게 예측할 수 있는가?
  • RQ3NLP 기술 없이 스파스 행렬 분해 접근법이 기존의 텍스트 기반 모델보다 주가 예측 정확도와 거래 성과에서 뛰어나게 되는가?
  • RQ4오래된 또는 관련 없는 뉴스 기사가 입력에 포함되어 있을 경우, 모델은 실제 세계의 제약 조건 하에서도 얼마나 잘 작동하는가?
  • RQ5이러한 모델이 표준 인덱스보다 높은 샤프 지수와 누적 수익률을 보이는 수익성 있는 거래 전략을 생성할 수 있는가?

주요 결과

  • 모델은 10만 건 이상의 테스트 케이스에서 전체적으로 55.7%의 방향성 예측 정확도를 달성하였으며, 51.5% 이하의 정확도를 보이는 전통적인 시계열 모델보다 뚜렷이 뛰어나다.
  • 모델은 매일 500개 이상의 주식에 대해 뉴스 기사에 언급되지 않은 날에도 주가 움직임을 성공적으로 예측할 수 있다.
  • 모델 기반의 백테스트 거래 전략은 테스트 기간 동안 누적 수익률 56%를 기록했으며, 벤치마크 인덱스보다 높은 샤프 지수를 확보했다.
  • 모델은 유로존 부채 위기 및 재정절벽 우려와 관련된 뉴스의 잠재 신호를 감지함으로써, 2012년 6월 1일과 11월 7일에 시장 하락을 사전에 예측했다.
  • 입력 뉴스의 대부분이 오래되었더라도 모델은 신선도를 필터링할 필요 없이 여전히 수익성 있는 신호를 생성하며 강건성을 유지한다.
  • 2013년에는 2012년보다 성능이 높았으며, 이는 시장 변동성이 낮고 기준 모델의 성능이 우수한 환경에서 본 모델이 특히 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.