[논문 리뷰] Improved Method of Stock Trading under Reinforcement Learning Based on DRQN and Sentiment Indicators ARBR
이 논문은 중국의 비효율적 시장에서 기억 한계와 비이성적 투자자 행동을 해결하기 위해 장기 기억 순환 신경망(LSTM) 네트워크와 ARBR 감성 지표를 통합한 개선된 딥 강화학습 모델인 DRQN-ARBR을 제안한다. 이 모델은 상태 표현을 향상시키고 장기 의존성을 학습함으로써 기존 DQN보다 우수한 거래 성능을 보이며, 뚜렷한 향상이 이루어진다.
With the application of artificial intelligence in the financial field, quantitative trading is considered to be profitable. Based on this, this paper proposes an improved deep recurrent DRQN-ARBR model because the existing quantitative trading model ignores the impact of irrational investor behavior on the market, making the application effect poor in an environment where the stock market in China is non-efficiency. By changing the fully connected layer in the original model to the LSTM layer and using the emotion indicator ARBR to construct a trading strategy, this model solves the problems of the traditional DQN model with limited memory for empirical data storage and the impact of observable Markov properties on performance. At the same time, this paper also improved the shortcomings of the original model with fewer stock states and chose more technical indicators as the input values of the model. The experimental results show that the DRQN-ARBR algorithm proposed in this paper can significantly improve the performance of reinforcement learning in stock trading.
연구 동기 및 목표
- 장기 의존성과 주식 거래 응용 분야에서의 제한된 기억을 다루는 데에 기존 DQN 모델의 한계를 해결하기 위해.
- 중국의 비효율적 주식 시장에서 비이성적 투자자 행동을 모델링하기 위해 특별히 ARBR를 포함한 감성 지표를 통합하기 위해.
- 기본 가격 데이터를 초과하는 다양한 기술 지표를 포함하여 주식 상태의 표현을 향상시키기 위해.
- 장기적 시간적 특징 학습을 위해 DRQN의 완전 연결 층을 LSTM 층으로 교체하여 모델 성능을 향상시키기 위해.
- 실제 거래 시나리오에서의 효과성을 실증적 백테스팅을 통해 검증하기 위해.
제안 방법
- 시퀀스 데이터 모델링과 기억 유지 능력을 향상시키기 위해 원래의 DRQN 모델에서 완전 연결 층을 LSTM 층으로 교체하기 위해.
- 투자자 행동에 영향을 받는 시장 감성 정보를 캡처하기 위해 ARBR 감성 지표를 추가 입력 특징으로 통합하기 위해.
- 가격과 거래량을 초월하여 여러 기술 지표를 포함하여 입력 상태 공간을 확장하여 특징 표현을 풍부하게 하기 위해.
- 누적 포트폴리오 수익률 기반의 보상 함수를 사용하여 강화학습 프레임워크에서 DRQN-ARBR 모델을 훈련하기 위해.
- 표준 DQN 및 DRQN 아키텍처와 동일하게 경험 재생과 타겟 네트워크를 활용하여 훈련을 안정화시키기 위해.
- 훈련 중 탐색과 이용의 균형을 유지하기 위해 에psilon-그리디 탐색을 채택하고 감쇠 스케줄을 적용하기 위해.
실험 결과
연구 질문
- RQ1DRQN의 완전 연결 층을 LSTM 층으로 교체함으로써 주식 거래 과제에서 성능 향상이 이루어지는가?
- RQ2ARBR 감성 지표를 통합함으로써 비효율적 시장에서 거래 전략의 성능 향상 정도는 어느 정도인가?
- RQ3여러 기술 지표를 포함하여 입력 상태 공간을 확장함으로써 모델의 학습 능력과 수익성에 어떤 영향을 미치는가?
- RQ4누적 수익률과 리스크 조정 성과 측정치 측면에서 DRQN-ARBR 모델이 표준 DQN 및 DRQN보다 뛰어난가?
- RQ5다양한 시장 조건과 데이터 분포에서 DRQN-ARBR 모델의 견고성은 어느 정도인가?
주요 결과
- DRQN-ARBR 모델은 중국 주식 시장 데이터에 대한 백테스팅에서 기준 DQN 및 DRQN 모델보다 뚜렷한 향상된 거래 성능을 보였다.
- ARBR 감성 지표의 통합은 특히 비이성적 투자자 행동가 장기 동안 시장 감성 변화에 더 잘 적응하는 데 기여했다.
- 완전 연결 층 대신 LSTM을 사용함으로써 시계열 가격 및 감성 데이터에서 장기 의존성을 더 잘 학습할 수 있는 능력이 향상되었다.
- 여러 기술 지표를 포함한 확장된 입력 상태 공간은 더 나은 거래 결정과 향상된 전략의 견고성에 기여했다.
- 실험 평가에서 모델는 더 높은 누적 수익률과 샤프 지수와 같은 리스크 조정 성과 지표에서 뛰어난 성능을 기록했다.
- 결과적으로 DRQN-ARBR는 비마르코프적이고 비효율적인 시장 환경에서 기존 DQN의 한계를 효과적으로 완화함을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.