[논문 리뷰] Evaluating the Performance of Machine Learning Algorithms in Financial Market Forecasting: A Comprehensive Survey
이 논문은 금융 시장 예측 분야의 기계학습에 관한 150개 이상의 연구를 종합적으로 조사하여, 일곱 가지 실험적 매개변수를 기준으로 알고리즘 성능을 평가한다. 분석 결과 기계학습 모델, 특히 순환 신경망(LSTM 및 GRU)이 비선형성과 시간적 의존성을 잘 포착할 수 있어, 다양한 자산 클래스와 지리적 지역에서 전통적인 확률 모델과 피드포워드 네트워크보다 뛰어난 성능을 보임을 확인하였다.
With increasing competition and pace in the financial markets, robust forecasting methods are becoming more and more valuable to investors. While machine learning algorithms offer a proven way of modeling non-linearities in time series, their advantages against common stochastic models in the domain of financial market prediction are largely based on limited empirical results. The same holds true for determining advantages of certain machine learning architectures against others. This study surveys more than 150 related articles on applying machine learning to financial market forecasting. Based on a comprehensive literature review, we build a table across seven main parameters describing the experiments conducted in these studies. Through listing and classifying different algorithms, we also introduce a simple, standardized syntax for textually representing machine learning algorithms. Based on performance metrics gathered from papers included in the survey, we further conduct rank analyses to assess the comparative performance of different algorithm classes. Our analysis shows that machine learning algorithms tend to outperform most traditional stochastic methods in financial market forecasting. We further find evidence that, on average, recurrent neural networks outperform feed forward neural networks as well as support vector machines which implies the existence of exploitable temporal dependencies in financial time series across multiple asset classes and geographies.
연구 동기 및 목표
- 다양한 연구들 간 기계학습 알고리즘의 금융 시장 예측 성능을 체계적으로 평가하기 위해.
- 금융 시계열 예측 분야에서 기계학습 응용의 학술적 통합과 표준화 부족 문제를 해결하기 위해.
- 다양한 시장과 자산 클래스에서의 실증적 성능 기반으로 가장 효과적인 알고리즘 클래스를 식별하고 순위를 매기기 위해.
- 기계학습 알고리즘을 텍스트로 표현하기 위한 표준화된 문법을 개발하여 재현 가능성과 비교 가능성 향상시키기 위해.
- 순환 네트워크가 장기적인 시간적 의존성을 모델링할 수 있다는 능력 덕분에 피드포워드 모델보다 성능이 뛰어나다는 가설을 검증하기 위해.
제안 방법
- 기계학습을 통한 금융 예측 분야의 150개 이상의 연구에 대한 체계적 문헌 조사를 수행하여 핵심 실험 매개변수를 추출하였다.
- 알고리즘 유형, 데이터셋, 예측 기간, 성능 지표, 시장, 자산 클래스, 지리적 지역의 일곱 가지 주요 매개변수를 기준으로 비교 표를 구축하였다.
- 약어와 계층적 표기법을 사용하여 인간이 이해할 수 있는 표준화된 문법을 제안하여 기계학습 알고리즘을 기술하였다.
- 포함된 연구들로부터 성능 지표(예: 정확도, AUC, RMSE)를 수집하고 알고리즘 클래스 간 순위 분석을 수행하였다.
- 비모수적 통계 순위 방법을 적용하여 개별 연구 설계의 편향을 최소화하면서 알고리즘 클래스 간 상대적 성능를 평가하였다.
- 교차 검증과 일반화 지표를 사용하여 평가 과정에서 모델의 강건성 확보 및 과적합 방지를 위해 노력하였다.
실험 결과
연구 질문
- RQ1기계학습 알고리즘 클래스 중에서 금융 시계열 예측에서 전통적인 확률 모델보다 일관되게 뛰어난 성능을 보이는 것은 무엇인가?
- RQ2순환 신경망(LSTM, GRU 등)은 피드포워드 네트워크 및 서포트 벡터 머신보다 얼마나 더 뛰어난 성능을 보이는가?
- RQ3주식, 외환, 상품 등 다양한 자산 클래스와 지리적 시장 간 일관된 성능 차이가 존재하는가?
- RQ4데이터셋, 예측 기간, 평가 지표를 통제할 경우 성능 순위는 어떻게 변하는가?
- RQ5기계학습 알고리즘을 기술하는 표준화된 문법은 재현 가능성과 비교 가능성 향상에 기여할 수 있는가?
주요 결과
- 기계학습 알고리즘, 특히 순환 신경망이 비선형성과 시간적 의존성을 잘 모델링할 수 있어 금융 시장 예측에서 전통적인 확률 모델보다 일관되게 뛰어난 성능을 보였다.
- LSTM 및 GRU를 포함한 순환 신경망은 다양한 데이터셋과 시장에서 피드포워드 네트워크 및 서포트 벡터 머신보다 유의미하게 높은 성능 순위를 기록하였다.
- 본 연구는 금융 시계열에서 장기적인 시간적 동적 변화를 포착하는 데서 RNN의 통계적으로 유의미한 우위를 규명하였으며, 이는 시장 데이터에 이용 가능한 패턴이 존재함을 시사한다.
- 성능 순위는 주식, 외환, 상품 등 다양한 자산 클래스와 지리적 지역에서 뚜렷하게 유지되어 RNN 기반 모델의 광범위한 적용 가능성을 보여주었다.
- 제안된 표준화된 기계학습 알고리즘 기술 문법은 향후 연구에서 더 명확한 소통과 재현 가능성을 가능하게 하였다.
- 서포트 벡터 머신과 피드포워드 네트워크는 중간 수준의 성능를 보였지만, 특히 장기 예측 과제에서는 RNN에 뒤지게 되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.