[논문 리뷰] Machine Learning for Forecasting Mid Price Movement using Limit Order Book Data
이 논문은 고빈도 거래에서 중간가격 움직임을 예측하기 위해 수작업으로 구성한 한정지정가주문서(LOB) 특징과 오토에인코더 및 백오브펑처(BoF) 모델을 통해 학습된 표현을 결합한 기계학습 프레임워크를 제안한다. 이 방법은 다양한 시간 범위에서 뚜렷한 예측 성능을 달성하며, 수작업 특징과 하이브리드 표현이 특히 다층퍼셉트론(MLP) 분류기와 조합될 경우 가장 우수한 성능을 보였다.
Forecasting the movements of stock prices is one the most challenging problems in financial markets analysis. In this paper, we use Machine Learning (ML) algorithms for the prediction of future price movements using limit order book data. Two different sets of features are combined and evaluated: handcrafted features based on the raw order book data and features extracted by ML algorithms, resulting in feature vectors with highly variant dimensionalities. Three classifiers are evaluated using combinations of these sets of features on two different evaluation setups and three prediction scenarios. Even though the large scale and high frequency nature of the limit order book poses several challenges, the scope of the conducted experiments and the significance of the experimental results indicate that Machine Learning highly befits this task carving the path towards future research in this field.
연구 동기 및 목표
- 한정지정가주문서(LOB) 데이터가 고빈도 거래에서 중간가격 움직임을 예측하는 데 충분한 예측 정보를 포함하고 있는지 조사하기 위해.
- 미래 가격 방향을 예측하는 데 있어 수작업으로 구성한 금융 특징과 기계학습으로 추출한 표현(예: 오토에인코더, BoF)의 효과성을 평가하기 위해.
- 다양한 특징 표현과 예측 시간 범위에서 다수의 분류기(SVM, MLP, SLFN)의 성능을 비교하기 위해.
- 실제 시장 환경에서의 도전 과제, 예를 들어 클래스 불균형, 높은 데이터 속도, 실시간 제약 조건을 고려하여 금융 예측의 정확도를 높이기 위해.
- 학습된 표현이 기존의 전통적 금융 특징을 향상시키거나 보완할 수 있는지 여부를 규명하기 위해.
제안 방법
- 연구는 수많은 가격 수준과 시간 포인트에서 입찰 및 매도 제안을 기록한 고빈도 한정지정가주문서 데이터를 입력으로 사용한다.
- 두 가지 유형의 특징을 추출한다: (1) 금융 전문 지식에 기반한 수작업 특징(예: 매도-매수 스프레드, 불균형, 주문 흐름), 및 (2) 오토에인코더(AE)와 백오브펑처(BoF) 모델을 사용한 학습된 표현.
- 특징 표현은 원시 연결(concat), 평균, 마지막 값, 하이브리드 형태(예: 마지막 + 평균, 마지막 ⊕ BoF)를 포함하며, 차원 수는 24에서 720까지 다양하다.
- Hold-out 및 워크포워드 검증 두 가지 실험 설정을 사용하여 다수의 분류기(SVM, MLP, SLFN)를 훈련하고 평가함으로써 일반화 능력과 실시간 성능를 평가한다.
- 통계적 유의성은 프리드먼 검정과 네멘요 post-hoc 분석을 통해 다양한 시나리오에서 분류기와 특징 표현 간의 성능을 비교하기 위해 사용된다.
- 예측 시나리오는 세 가지로 나뉜다: 즉각적인 다음 샘플, 다음 5개 샘플의 평균 이동, 다음 10개 샘플의 평균 이동.
실험 결과
연구 질문
- RQ1기계학습 모델이 한정지정가주문서 데이터만을 사용하여 중간가격 움직임을 효과적으로 예측할 수 있는가?
- RQ2수작업으로 구성한 금융 특징과 기계학습으로 추출한 표현 간의 성능를 비교했을 때, 어떤 것이 더 뛰어난가?
- RQ3어떤 특징 표현과 분류기의 조합이 다양한 시간 범위에서 가장 높은 예측 정확도를 달성하는가?
- RQ4입력 표현의 차원 수가 모델 성능에 영향을 미치는가? 그리고 계산 효율성과 예측 능력 사이에 트레이드오프가 존재하는가?
- RQ5고빈도 금융 데이터에서 흔히 발생하는 실시간 제약 조건과 클래스 불균형 상황에서 분류기의 성능는 어떠한가?
주요 결과
- 모든 시나리오에서 MLP 분류기가 SVM 및 SLFN보다 뛰어난 성능을 보였으며, SLFN에 비해 통계적으로 유의미한 향상이 있었지만, MLP와 SVM 간의 차이는 α=0.1 수준에서 유의미하지 않았다.
- 시간 정보를 포함한 수작업 특징—특히 평균 및 마지막+평균 표현—이 다른 표현들보다 가장 정확한 예측을 제공했으며, 유의미하게 뛰어난 성능를 보였다.
- 차원 수가 동일한 상황에서도 평균 표현이 마지막 표현보다 더 좋은 결과를 내는 이유는 평균화로 인한 노이즈 감소 효과 덕분이었다.
- BoF 및 마지막 ⊕ BoF 표현은 양호한 성능를 보였지만, 입력 차원 수가 감소함에 따라 성능 저하가 발생했으며, 이는 효율성과 분류 능력 사이의 트레이드오프를 시사했다.
- 수작업 특징과 학습된 특징을 조합하면 예측 성능이 향상되었으며, 이는 기계학습으로 추출된 특징이 전통적 특징이 포착하지 못한 잠재적 보조 지식을 드러내고 있음을 보여주었다.
- 프리드먼 검정은 귀무가설을 강력히 기각했으며(p=5.5×10⁻³⁵), 최소한 하나의 특징 표현 또는 분류기가 유의미하게 다른 성능를 보였음을 확인했으며, 네멘요 검정을 통해 가장 효과적인 구성이 특정으로 규명되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.