[논문 리뷰] Compatible deep neural network framework with financial time series data, including data preprocessor, neural network model and trading strategy
이 논문은 금융 시계열 예측을 위한 새로운 종단 간 호환성 있는 딥러닝 프레임워크를 제안한다. 이 프레임워크는 데이터 전처리, 하이브리드 CNN-LSTM 신경망, 그리고 동적 거래 전략을 통합한다. 기술적 지표, XGBoost 기반 특성 선택, 다중 카테고리 데이터 분할, 그리고 이중 CNN 기반 오토인코더를 통한 특성 추출을 통해, 비트코인(BTC), 이더리움(ETH), S&P500 데이터셋에서 1년 동안 10배에서 12배의 수익 증가를 달성한다.
Experience has shown that trading in stock and cryptocurrency markets has the potential to be highly profitable. In this light, considerable effort has been recently devoted to investigate how to apply machine learning and deep learning to interpret and predict market behavior. This research introduces a new deep neural network architecture and a novel idea of how to prepare financial data before feeding them to the model. In the data preparation part, the first step is to generate many features using technical indicators and then apply the XGBoost model for feature engineering. Splitting data into three categories and using separate autoencoders, we extract high-level mixed features at the second step. This data preprocessing is introduced to predict price movements. Regarding modeling, different convolutional layers, an long short-term memory unit, and several fully-connected layers have been designed to perform binary classification. This research also introduces a trading strategy to exploit the trained model outputs. Three different datasets are used to evaluate this method, where results indicate that this framework can provide us with profitable and robust predictions.
연구 동기 및 목표
- 데이터 준비, 모델링, 거래 실행을 연결하는 종합적이고 실세계 적용 가능한 딥러닝 프레임워크를 개발하기 위해.
- 거래 행동에 기반한 직관적인 데이터 전처리 파이프라인을 도입하여 특성 품질과 시장 변동성 문제를 해결하기 위해.
- 지역 패턴(컨볼루션 레이어를 통해)과 시간적 의존성(LSTM을 통해)을 모두 포착하는 신경망 아키텍처를 설계하여 가격 방향에 대한 정확한 이진 분류를 수행하기 위해.
- 마진 제약 조건과 리스크 관리 조건을 고려한 현실적인 거래 조건 하에서 프레임워크의 수익성 평가하기 위해.
- 암호화자산(BTC, ETH)과 주식(S&P500)을 포함한 다양한 금융 자산에 대해 다양한 시간 간격에서 뛰어난 성능을 보여주기 위해.
제안 방법
- OHLCV(시가, 고가, 저가, 종가, 거래량) 데이터로부터 광범위한 기술적 지표를 생성하여 특성 공간을 풍부하게 한다.
- 예측 중요도 기반으로 정보성 높은 특성을 우선순위 정렬하기 위해 XGBoost를 사용하여 특성 선택을 수행한다.
- 시장 상태 기반으로 특성 학습의 맥락을 고려하기 위해 데이터를 세 가지 다른 카테고리(예: 호재장, 약세장, 횡보장)로 분할한다.
- 각기 다른 데이터 분할에 대해 훈련된 두 개의 커스터마이징된 CNN 기반 오토인코더를 활용하여 금융 특성의 고수준, 노이즈 제거 및 압축된 표현을 추출한다.
- 공간적 특성 정제를 위한 컨볼루션 레이어, 순차적 의존성 모델링을 위한 LSTM 레이어, 가격 방향 이진 분류를 위한 완전 연결 레이어를 포함한 하이브리드 딥 네트워크 아키텍처를 설계한다.
- 모델 신뢰도 점수(θ 기준)를 활용하여 진입/청산 포인트를 결정하는 동적 거래 전략을 구현하며, 수익 보존 마진 조건 유무에 따라 별도 평가를 수행한다.
실험 결과
연구 질문
- RQ1금융 시계열 데이터는 어떻게 전처리할 수 있을까? 이는 실제 거래자 행동과 시장 제도 변화를 반영해야 한다.
- RQ2시장 상태별로 훈련된 오토인코더가 금융 예측에서 특성 품질 향상과 모델 일반화 능력 향상에 얼마나 기여할 수 있는가?
- RQ3하이브리드 CNN-LSTM 아키텍처가 변동성이 높은 시장에서 한 단계 앞선 가격 방향 예측에 기존 딥러닝 모델보다 뛰어난 성능을 보일 수 있는가?
- RQ4마진 제약 조건이 있는 현실적인 조건에서, 모델 기반 거래 전략이 다양한 금융 자산(암호화자산 및 주식)에 적용되었을 때 수익성은 어떠한가?
- RQ5모델 성능과 거래 수익성은 다양한 시장 제도와 자산 유형 간에 어떻게 달라지는가?
주요 결과
- 프레임워크는 BTC/USDT, ETH/USDT, S&P500 데이터셋에서 1년 동안 포트폴리오 가치가 10배에서 12배로 증가하여 높은 수익성을 입증했다.
- 모든 데이터셋에서 모델 성능이 우수했으며, F1 점수, 정밀도, 재현율 값이 가격 방향 예측에 대한 강력한 이진 분류 정확도를 나타냈다.
- 신뢰도 임계값 θ를 1/4로 설정할 경우 수익성이 감소했으며, 이는 과도한 민감도로 인한 결과로, 리스크 조정된 거래에서 최적의 임계값 선택의 중요성을 강조한다.
- 분할된 데이터에 대해 별도의 오토인코더를 사용함으로써 특성 표현과 모델 일반화 능력이 향상되었으며, 특히 비정상적이고 변동성이 높은 시장 조건에서 유의미한 효과를 보였다.
- XGBoost 기반 특성 엔지니어링의 통합은 정보성이 낮은 특성을 걸러내어 모델 성능을 크게 향상시켰다.
- 수익 보존 마진 조건이 적용된 거래 전략은 더 지속 가능하고 현실적인 수익성을 보였으며, 이는 프레임워크의 실용적 적용 가능성을 검증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.