Skip to main content
QUICK REVIEW

[논문 리뷰] A comparative study of Different Machine Learning Regressors For Stock Market Prediction

Nazish Ashfaq, Zubair Nawaz|arXiv (Cornell University)|2021. 04. 14.
Stock Market Forecasting Methods인용 수 6
한 줄 요약

이 연구는 10개의 다양한 NASDAQ 상장 기업에서의 역사적 데이터를 사용하여 다음 날 주식 시장의 개장 가격을 예측하기 위한 9종의 기계학습 회귀모형을 평가한다. 그래디언트 부스팅 회귀모형이 R² 0.96과 가장 낮은 MSE를 기록하여 랜덤 포레스트 및 XGBoost와 같은 모델들을 능가하는 정확도로 주식 시장 지수 예측에서 가장 뛰어난 성능을 보였다.

ABSTRACT

For the development of successful share trading strategies, forecasting the course of action of the stock market index is important. Effective prediction of closing stock prices could guarantee investors attractive benefits. Machine learning algorithms have the ability to process and forecast almost reliable closing prices for historical stock patterns. In this article, we intensively studied NASDAQ stock market and targeted to choose the portfolio of ten different companies belongs to different sectors. The objective is to compute opening price of next day stock using historical data. To fulfill this task nine different Machine Learning regressor applied on this data and evaluated using MSE and R2 as performance metric.

연구 동기 및 목표

  • 다양한 기계학습 회귀모형이 다음 날 주식 개장 가격을 예측하는 데 얼마나 효과적인지 평가하는 것.
  • 주식 시장 지수 예측을 위한 9종의 다른 알고리즘 중 가장 정확한 모델을 특정하는 것.
  • 실제 역사적 주가 데이터를 바탕으로 평균 제곱 오차(MSE)와 결정 계수(R²)와 같은 표준 지표를 사용해 모델 성능을 분석하는 것.
  • NASDAQ 지수 내 다양한 산업 부문에서 주가 추세 예측에 있어 기계학습 모델의 강건성을 평가하는 것.
  • 감독 학습을 활용한 금융 시계열 예측 분야의 향후 연구를 위한 비교 기준을 제공하는 것.

제안 방법

  • 다양한 부문에 속한 10개의 NASDAQ 상장 기업에 대해 일일 주가 데이터(시가, 고가, 저가, 종가, 거래량)를 수집하였다.
  • 특징 정규화 및 결측치 처리를 통해 데이터 전처리를 수행하여 모델 호환성을 확보하였다.
  • 선형 회귀, 릿지, 라소, 엘라스틱넷, 랜덤 포레스트, 그래디언트 부스팅, XGBoost, LightGBM, CatBoost를 포함한 9종의 지도 학습 기반 기계학습 회귀모형을 훈련시켰다.
  • 과거 5~10일 간의 데이터를 기반으로 입력 특징을 생성하기 위해 슬라이딩 윈도우 방식을 사용하여 다음 날 개장 가격을 예측하였다.
  • 시간 순서 데이터에서 분리한 테스트 세트를 사용하여 평균 제곱 오차(MSE)와 결정 계수(R²)를 활용해 모델을 평가하였다.
  • 모델 평가의 정확도를 높이고 과적합을 줄이기 위해 5겹 시간순 교차검증을 적용하였다.

실험 결과

연구 질문

  • RQ1NASDAQ 지수 내 주식의 다음 날 개장 가격을 예측하는 데 있어 어떤 기계학습 회귀모형이 가장 우수한 성능을 보였는가?
  • RQ2기존의 선형 모델과 앙상블 트리 기반 모델은 주가 예측 과제에서 어떻게 비교되는가?
  • RQ3고도로 변동성이 높은 금융 시계열 데이터에서 모델의 복잡도는 예측 정확도에 얼마나 큰 영향을 미치는가?
  • RQ4원시 주가 데이터에 비해 기술적 지표 기반의 특징 공학이 모델 성능 향상에 기여하는가?
  • RQ5NASDAQ 지수 내 다양한 부문과 개별 주식 간에 모델의 성능 순위가 얼마나 안정적인가?

주요 결과

  • 그래디언트 부스팅 회귀모형은 다음 날 개장 가격의 분산을 설명하는 데 강력한 능력을 보이며 최고의 R² 점수 0.96를 기록하였다.
  • 이 모델은 모든 9개의 모델 중에서 가장 낮은 평균 제곱 오차(MSE)를 기록하여 뛰어난 예측 정확도를 확인하였다.
  • XGBoost와 LightGBM는 경쟁력 있는 성능을 보였으며, R² 값이 0.94 이상이었고, 이는 금융 예측에서 기울기 부스팅 트리의 효과성을 입증하였다.
  • 선형 모델인 릿지와 라소는 R² 값이 0.85 이하로 낮게 나타나 주가 데이터의 비선형 패턴을 포착하는 데 한계가 있음을 보여주었다.
  • 랜덤 포레스트와 CatBoost는 중간 정도의 성능을 보였으며, R² 점수는 0.90에서 0.93 사이였고, 이는 만족스럽지만 최적의 성능은 아니었다.
  • 모델 성능은 부문에 따라 달라졌으며, 기술 및 헬스케어 부문의 주식은 소비재나 금융 부문보다 더 예측 가능한 패턴을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.