Skip to main content
QUICK REVIEW

[논문 리뷰] Using Machine Learning and Alternative Data to Predict Movements in Market Risk

Thomas Dierckx, Jesse Davis|arXiv (Cornell University)|2020. 09. 16.
Stock Market Forecasting Methods인용 수 4
한 줄 요약

이 논문은 정량적 시장 데이터와 구글 뉴스, 위키백과 페이지 조회수와 같은 대체 데이터 소스를 활용하여 기계학습 모델이 애플 주식의 시장이 암시하는 변동성의 일일 변동을 예측할 수 있는지 조사한다. 유일하게 시장 데이터만을 사용했을 때 예측 정확도가 가장 높았으며(서포트 벡터 머신을 사용한 경우 64.2%의 균형 정확도), 연구는 위키백과 트래픽과 시장이 암시하는 변동성 간의 비선형 관계를 드러내며, 더 나은 특징 공학 또는 비선형 알고리즘을 사용할 경우 모델 성능 향상 가능성을 시사한다.

ABSTRACT

Using machine learning and alternative data for the prediction of financial markets has been a popular topic in recent years. Many financial variables such as stock price, historical volatility and trade volume have already been through extensive investigation. Remarkably, we found no existing research on the prediction of an asset's market implied volatility within this context. This forward-looking measure gauges the sentiment on the future volatility of an asset, and is deemed one of the most important parameters in the world of derivatives. The ability to predict this statistic may therefore provide a competitive edge to practitioners of market making and asset management alike. Consequently, in this paper we investigate Google News statistics and Wikipedia site traffic as alternative data sources to quantitative market data and consider Logistic Regression, Support Vector Machines and AdaBoost as machine learning models. We show that movements in market implied volatility can indeed be predicted through the help of machine learning techniques. Although the employed alternative data appears to not enhance predictive accuracy, we reveal preliminary evidence of non-linear relationships between features obtained from Wikipedia page traffic and movements in market implied volatility.

연구 동기 및 목표

  • 기계학습 모델이 애플 주식의 시장이 암시하는 변동성의 다음 날 방향 변화를 예측할 수 있는지 확인하는 것.
  • 특히 구글 뉴스 카운트와 위키백과 페이지 뷰와 같은 대체 데이터가 예측 성능에 미치는 영향을 평가하는 것.
  • 대체 데이터 특징과 시장이 암시하는 변동성 간의 비선형 관계가 존재하는지 평가하는 것.
  • 제한된 옵션 데이터를 활용해 기계학습 모델로 변동성 이동을 예측하는 것이 가능한지 탐색하는 것.
  • 향후 연구를 위한 타겟 구성 및 모델 캘리브레이션 향상 가능성을 규명하는 것.

제안 방법

  • 379일의 훈련 윈도우와 하루의 검증 예측을 포함한 슬라이딩 윈도우 워크-프론트 검증을 사용하여 총 106개의 테스트 케이스를 확보함.
  • 수익률, 변동성, 거래량 등의 정량적 시장 데이터, 구글 뉴스 카운트, 위키백과 페이지 뷰에서 특징을 추출함.
  • 로지스틱 회귀, RBF 커널 서포트 벡터 머신, 어댑티브 부스팅을 사용한 기계학습 모델 3종을 사용하였으며, scikit-learn의 기본 설정을 그대로 적용함.
  • 타겟 변수의 클래스 불균형(하락 59%, 상승 41%)을 고려해 예측 성능 평가에 균형 정확도를 사용함.
  • 다섯 가지 데이터 소스 시나리오에 대해 분석 실험을 수행함: 시장 데이터만, 시장 + 구글 뉴스, 시장 + 위키백과, 시장 + 양자, 시장 + 양자 + 추가 특징.
  • 모델 신뢰도를 분석하기 위해 예측 확률이 정밀도 및 이동 폭과의 상관관계를 검토함.

실험 결과

연구 질문

  • RQ1기계학습 모델은 애플 주식의 시장이 암시하는 변동성의 다음 날 방향 변화를 예측할 수 있는가?
  • RQ2구글 뉴스 및 위키백과와 같은 대체 데이터를 통합할 경우 정량적 시장 데이터만 사용할 때보다 예측 정확도가 향상되는가?
  • RQ3위키백과 트래픽 특징과 변동성 이동 간의 비선형 관계가 존재하는가? 이러한 관계는 선형 모델이 놓칠 수 있는가?
  • RQ4클래스 불균형은 모델 성능에 어떤 영향을 미치며, 균형 정확도가 더 신뢰할 수 있는 평가 지표인가?
  • RQ5모델의 신뢰도 점수(예측 확률)는 더 정밀한 예측을 식별하거나 이동 폭과 상관관계를 가지는 데 사용될 수 있는가?

주요 결과

  • 정량적 시장 데이터만을 사용했을 때 최고의 예측 성능를 기록하였으며, RBF 커널 서포트 벡터 머신을 사용한 경우 균형 정확도가 64.2%였다.
  • 구글 뉴스 카운트를 통합할 경우 모든 모델에서 성능 저하가 발생하여 이 데이터 소스의 예측가능성은 제한적임을 시사함.
  • 위키백과 페이지 뷰는 시장이 암시하는 변동성 이동과 비선형 관계를 보였으며, 이는 어댑티브 부스팅 모델이 이 특징을 포함했을 때 다른 모델보다 뛰어난 성능을 보여줌.
  • 로지스틱 회귀는 위키백과 특징을 사용했을 때 성능이 열등하여 이 관계가 비선형일 가능성이 크며, 앙상블 방법이 더 잘 포착함을 시사함.
  • 대체 데이터를 포함한 최고의 결과는 어댑티브 부스팅을 사용한 시장 + 위키백과 특징 조합에서 63.0%의 균형 정확도였으며, 여전히 시장 데이터만 사용한 기준선보다 낮음.
  • 모든 데이터 소스를 통합한 결과에 유의미한 향상이 없었으며, 이는 특징 노이즈 또는 모델 한계로 인해 작은 데이터셋에서 일반화 성능이 저하되었을 가능성을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.