[논문 리뷰] Application of deep reinforcement learning for Indian stock trading automation
이 논문은 인도 주식 시장에서 주식 거래를 자동화하기 위해 딥 레이어닝 강화학습(DRL)을 적용하며, 세 가지 DRL 모델—딥 Q 네트워크(DQN), 듀얼러블 듀얼 DQN—을 사용하여 10종의 인도 주식 데이터셋에 대해 평가한다. 듀얼러블 듀얼 DQN 모델이 수익 창출과 안정성 면에서 다른 모델들을 능가하여 역사적 가격 및 기술적 지표 데이터를 기반으로 한 적응형 거래 결정을 통해 장기 수익을 극대화하는 데 뛰어난 성능을 보였다.
In stock trading, feature extraction and trading strategy design are the two important tasks to achieve long-term benefits using machine learning techniques. Several methods have been proposed to design trading strategy by acquiring trading signals to maximize the rewards. In the present paper the theory of deep reinforcement learning is applied for stock trading strategy and investment decisions to Indian markets. The experiments are performed systematically with three classical Deep Reinforcement Learning models Deep Q-Network, Double Deep Q-Network and Dueling Double Deep Q-Network on ten Indian stock datasets. The performance of the models are evaluated and comparison is made.
연구 동기 및 목표
- 딥 레이어닝 강화학습을 활용해 인도 주식 시장에서 주식 거래 결정을 자동화한다.
- 실제 인도 주식 데이터를 기반으로 세 가지 DRL 모델—DQN, 듀얼러블 듀얼 DQN—의 성능을 평가하고 비교한다.
- 역사적 가격 및 기술적 지표 데이터로부터 유도된 적응형 거래 전략을 통해 장기 수익을 극대화한다.
- 후행 시기의 미사용 데이터를 활용한 테스트를 통해 모델의 일반화 능력을 검증한다.
- 고도로 변동성이 크고 확률적인 금융 시장 환경에서 DRL 모델의 강건성과 안정성을 평가한다.
제안 방법
- DRL 에이전트는 경험 재생과 타겟 네트워크를 사용한 딥 Q 네트워크(DQN) 아키텍처를 활용하여 학습 안정성과 Q-값의 과대평가를 감소시킨다.
- 더블 DQN은 온라인 네트워크에서 행동 선택과 타겟 네트워크에서 가치 추정을 분리함으로써 안정성을 향상시키고 과대평가 편향을 줄인다.
- 듀얼러블 더블 DQN은 가치 함수와 이점 함수를 분리함으로써 더 나은 상태 평가 및 행동 선택을 가능하게 하여 성능을 추가로 향상시킨다.
- 모델들은 역사적 주식 데이터의 90일 윈도우를 기반으로 학습되며, 배치 크기 64, 학습률 0.00025, 이psilon 감쇠율 0.995 등의 하이퍼파라미터를 포함한다.
- 환경은 기술적 지표와 가격 변동성 등의 상태 특징으로 정의되며, 행동은 '매수', '매도', '持仓'로 분류된다.
- 에이전트의 성능은 훈련 데이터와 미사용 테스트 데이터 모두에서 총 수익과 누적 보상으로 평가된다.
실험 결과
연구 질문
- RQ1DQN, 더블 DQN, 듀얼러블 더블 DQN는 인도 주식 거래 자동화에서 얼마나 뛰어난 수익 창출 성능를 보여주는가?
- RQ2변동성이 큰 인도 주식 시장에서 어떤 DRL 모델 아키텍처가 테스트 데이터에 대해 가장 높은 안정성과 일반화 능력을 보이는가?
- RQ3딥 레이어닝 강화학습은 장기 주식 거래 결정에서 전통적인 기술적 분석 및 머신러닝 방법을 얼마나 뛰어나게 성능을 발휘할 수 있는가?
- RQ4경험 재생과 타겟 네트워크의 사용은 고빈도, 비정상적인 금융 데이터에서 수렴성과 성능에 어떤 영향을 미치는가?
- RQ5듀얼러블 더블 DQN의 가치-이점 분해 구조는 표준 DQN과 더블 DQN에 비해 더 나은 행동 선택과 더 높은 누적 수익을 이끌 수 있는가?
주요 결과
- 듀얼러블 더블 DQN 모델은 10종의 인도 주식 전반에서 가장 높은 평균 테스트 수익을 기록했으며, NESTLEIND의 경우 테스트 수익 101,731, ULTRACEMCO의 경우 57,626를 기록했다.
- 더블 DQN은 훈련 및 테스트 단계에서 표준 DQN을 능가했으며, TCS의 경우 테스트 수익 38,095, ULTRACEMCO의 경우 57,626를 기록했고, DQN의 경우 각각 4,770과 25,188이었다.
- 평균적으로 듀얼러블 더블 DQN는 DQN(예: TCS의 경우 22, NESTLEIND의 경우 -180)보다 훨씬 높은 테스트 보상(예: TCS의 경우 114, NESTLEIND의 경우 79)을 기록하여 더 나은 정책 학습 능력을 보였다.
- 듀얼러블 더블 DQN 모델은 특히 ULTRACEMCO 데이터셋에서 가장 안정적인 학습 손실과 일관된 보상 진행 추세를 보였으며, 그림 5에 나타나 있다.
- 강력한 훈련 데이터 성능에도 불구하고 DQN은 여러 주식에서 높은 변동성과 음수 테스트 수익(예: TECHM: -678)을 보여 과적합과 불안정성을 드러냈다.
- 모델들은 변동성이 큰 시장 환경에 뛰어난 적응력을 보였으며, 다양한 주식에서 듀얼러블 더블 DQN가 수익 및 보상 지표 면에서 항상 다른 모델들을 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.