Skip to main content
QUICK REVIEW

[논문 리뷰] The Short-Term Predictability of Returns in Order Book Markets: a Deep Learning Perspective

Lorenzo Lucchese, Mikko S. Pakkanen|arXiv (Cornell University)|2022. 11. 24.
Stock Market Forecasting Methods인용 수 8
한 줄 요약

이 논문은 고빈도 주문서 시장에서의 단기 예측 가능성에 대해 딥러닝을 활용하여 조사하며, 주문서 데이터의 새로운 볼륨 표현 방식을 도입한다. 결과적으로 다양한 주식과 예측 기간 동안 중간가격 수익률이 주문서 동적 요소에 의해 예측 가능하게 영향을 받는 것으로 나타났으며, 볼륨 표현 방식이 모델 성능을 크게 향상시킨다.

ABSTRACT

In this paper, we conduct a systematic large-scale analysis of order book-driven predictability in high-frequency returns by leveraging deep learning techniques. First, we introduce a new and robust representation of the order book, the volume representation. Next, we carry out an extensive empirical experiment to address various questions regarding predictability. We investigate if and how far ahead there is predictability, the importance of a robust data representation, the advantages of multi-horizon modeling, and the presence of universal trading patterns. We use model confidence sets, which provide a formalized statistical inference framework particularly well suited to answer these questions. Our findings show that at high frequencies predictability in mid-price returns is not just present, but ubiquitous. The performance of the deep learning models is strongly dependent on the choice of order book representation, and in this respect, the volume representation appears to have multiple practical advantages.

연구 동기 및 목표

  • 고빈도 주가 수익률이 주문서 데이터에 의해 예측 가능하게 영향을 받는지 조사하여 초고빈도에서의 시장 효율성 가정에 도전한다.
  • 다양한 주문서 데이터 표현 방식이 딥러닝 모델의 수익률 예측 성능에 미치는 영향을 평가한다.
  • 딥러닝 모델이 수익률 예측에 대해 다중 예측 기간 및 다중 주식으로 일반화 가능한지 평가한다.
  • 예측 성능을 철저히 평가하기 위해 모델 신뢰도 집합을 활용한 공식적인 통계적 추론 프레임워크를 제공한다.

제안 방법

  • 시간에 따라 양도 및 매도 측의 각 가격 수준에서의 큐 볼륨을 인코딩하는 새로운 주문서 표현 방식인 '볼륨 표현'을 제안한다.
  • 다양한 시간 필터 크기를 갖는 인셉션 모듈을 포함한 컨volutional 및 순환층 기반의 딥러닝 아키텍처를 사용하여 다중 척도 동적 특성을 캡처한다.
  • 어텐션 메커니즘을 활용한 시퀀스-투-시퀀스 모델을 사용하여 향후 시간 단위에서 중간가격 수익률 방향(상승, 하락, 정체)의 다중 예측 기간 예측을 가능하게 한다.
  • 모델 간 예측 성능를 공식적으로 비교하기 위해 모델 신뢰도 집합(MCS)을 적용하여 통계적 안정성을 확보한다.
  • 공통된 하이퍼파ram터를 사용하는 표준화된 딥러닝 파이프라인을 활용해 여러 주식에 걸쳐 나스닥 고빈도 데이터를 기반으로 모델을 훈련 및 평가한다.
  • 시간적 컨volutional 네트워크와 장기 순환 신경망(LSTM) 유닛을 통합하여 주문서 동적 특성의 국소적 및 장기적 의존성을 모델링한다.

실험 결과

연구 질문

  • RQ1고빈도 주문서 시장에서 주문서 데이터가 향후 중간가격 수익률에 대해 통계적으로 유의미한 예측 가능성을 지니는가? 만약 그렇다면, 얼마나 먼 미래까지 예측 가능할 수 있는가?
  • RQ2특히 제안된 볼륨 표현 방식을 포함한 주문서 표현 방식의 선택이 딥러닝 모델의 예측 성능에 어떤 영향을 미치는가?
  • RQ3단일 딥러닝 모델이 다중 예측 기간(다중 기간 모델링)을 효과적으로 예측할 수 있으며, 이는 단일 기간 모델 대비 성능 향상을 이끌어내는가?
  • RQ4다양한 주식 간에 보편적인 거래 패턴이 존재하는가? 즉, 한 모델이 여러 주식에 대해 효과적으로 일반화 가능한가?

주요 결과

  • 주문서 시장에서의 고빈도 수익률은 광범위하고 통계적으로 유의미한 예측 가능성을 보이며, 모든 테스트 주식과 예측 기간에서 무작위 추측을 뛰어넘는 일관된 성능을 기록한다.
  • 전통적인 표현 방식에 비해 볼륨 표현 방식이 예측 정확도 측면에서 뚜렷이 뛰어나며, 다양한 주식에 걸쳐 높은 강건성과 일반화 능력을 입증한다.
  • 어 attention 메커니즘을 갖춘 시퀀스-투-시퀀스 아키텍처를 사용한 다중 예측 기간 모델링은 단일 기간 모델 대비 예측 성능을 향상시키며, 향후 수익률 경로를 함께 모델링하는 것이 학습에 도움이 된다는 것을 시사한다.
  • 한 주식에서 훈련된 단일 딥러닝 모델이 다른 주식으로도 상당히 잘 일반화되며, 주문서 동적 특성에 보편적인 다자산 거래 패턴이 존재한다는 것을 시사한다.
  • 모델 신뢰도 집합(MCS)을 통한 분석 결과, 볼륨 표현 방식을 사용한 모델가 다른 대안보다 통계적으로 뛰어나며, 이 표현 방식의 우월성이 강력한 신뢰도를 지닌다는 p-값이 확인되었다.
  • 다양한 표현 방식을 사용한 모델 간 성능 격차는 뚜렷하며, 볼륨 표현 방식은 예측 기간 평균 분류 정확도 약 58%를 기록하여 기준값인 50%를 크게 상회한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.