[논문 리뷰] Reinforcement-Learning based Portfolio Management with Augmented Asset Movement Prediction States
이 논문은 자산 가격과 금융 뉴스와 같은 이질적 데이터를 통합하여 예측된 가격 변동을 추가 상태로 활용하는 상태증강 강화학습(SARL) 프레임워크를 제안한다. 이 방법은 포트폴리오 성과와 리스크 조정 수익률을 크게 향상시키며, 비트코인 및 하이테크 데이터셋에서 최신 기술 대비 누적 수익률 140.9–15.7% 향상 및 최대 40.45% 향상된 샤프 지수를 달성한다.
Portfolio management (PM) is a fundamental financial planning task that aims to achieve investment goals such as maximal profits or minimal risks. Its decision process involves continuous derivation of valuable information from various data sources and sequential decision optimization, which is a prospective research direction for reinforcement learning (RL). In this paper, we propose SARL, a novel State-Augmented RL framework for PM. Our framework aims to address two unique challenges in financial PM: (1) data heterogeneity -- the collected information for each asset is usually diverse, noisy and imbalanced (e.g., news articles); and (2) environment uncertainty -- the financial market is versatile and non-stationary. To incorporate heterogeneous data and enhance robustness against environment uncertainty, our SARL augments the asset information with their price movement prediction as additional states, where the prediction can be solely based on financial data (e.g., asset prices) or derived from alternative sources such as news. Experiments on two real-world datasets, (i) Bitcoin market and (ii) HighTech stock market with 7-year Reuters news articles, validate the effectiveness of SARL over existing PM approaches, both in terms of accumulated profits and risk-adjusted profits. Moreover, extensive simulations are conducted to demonstrate the importance of our proposed state augmentation, providing new insights and boosting performance significantly over standard RL-based PM method and other baselines.
연구 동기 및 목표
- 구조화된 가격 데이터와 비구조화된 뉴스 등 다양한 정보가 혼재된 금융 포트폴리오 관리에서의 데이터 이질성 문제를 해결한다.
- 비정상적인 금융 시장과 학습 및 테스트 데이터 간의 분포 이질성으로 인한 환경의 불확실성을 완화한다.
- 예측 신호를 통한 상태 증강을 통해 강화학습 기반 포트폴리오 전략의 일반화 및 강인성을 향상시킨다.
- 예측 신호가 정보를 잘 담고 있다면, 외부의 노이즈가 많거나 희박한 정보를 통합함으로써 포트폴리오 성과를 향상시킬 수 있음을 입증한다.
- 기본 RL 및 기존 포트폴리오 관리 기준선 대비 SARL의 우수성을 누적 수익률과 샤프 지수와 같은 리스크 조정 지표에서 검증한다.
제안 방법
- 기존 강화학습의 상태 공간을 확장하여 자산 가격 변동 예측을 추가 상태로 포함하는 일반적인 상태증강 강화학습(SARL) 프레임워크를 제안한다.
- 이전 자산 가격 및 뉴스 기사와 같은 다양한 데이터 소스를 활용해 가격 변동 예측을 생성하고, 이를 증강 상태로 통합한다.
- 금융 뉴스를 벡터 표현으로 변환하여 상태 공간에 통합하기 위해 사전 학습된 자연어 처리 모델(예: BERT 기반 임베딩)을 활용한다.
- 기본 강화학습 알고리즘(예: PPO, DPG, PG)을 사용해 증강된 상태 공간에서 RL 에이전트를 훈련시켜 최적의 포트폴리오 배분 정책을 학습한다.
- 예측 정확도와 레이블 희박성의 다양한 수준을 시뮬레이션하여 불확실성 하에서의 강인성과 일반화 능력을 평가한다.
- 실세계 데이터셋에서 DPM(포트폴리오 관리용 딥 Q넷) 및 전통적인 포트폴리오 관리 전략(CRP, OLMAR, WMAMR)과의 비교를 통해 SARL을 평가한다.
실험 결과
연구 질문
- RQ1금융 뉴스와 같은 이질적 데이터 소스를 강화학습의 상태 공간에 통합하면 포트폴리오 관리 성과가 향상되는가?
- RQ2외부 가격 변동 예측의 정확도와 희박성이 강화학습 기반 포트폴리오 에이전트의 성능에 어떤 영향을 미치는가?
- RQ3분포 이질성과 시장 불확실성 하에서 SARL은 기존 강화학습 기반 포트폴리오 관리 방법보다 더 잘 일반화되는가?
- RQ4노이즈가 많거나 빈도가 낮은 외부 신호가 증강 상태로 통합될 경우, 얼마나까지 포트폴리오 수익률을 향상시킬 수 있는가?
- RQ5금융 뉴스에 숨겨진 의미적 상관관계가 증강된 상태 표현의 예측 능력을 향상시키는 데 어떤 역할을 하는가?
주요 결과
- 비트코인 데이터셋에서 SARL는 최신 기술 대비 누적 수익률 140.9% 향상하여 뚜렷한 성과 향상을 입증했다.
- 하이테크 주식 데이터셋에서 SARL는 모든 기준선 대비 누적 수익률 15.7% 향상 및 샤프 지수 40.45% 향상하여 뛰어난 성능을 보였다.
- 60% 정확도이지만 무작위로 시뮬레이션된 예측 레이블 조건에서도 SARL는 DPM를 능가하여 노이즈가 많은 외부 신호에 대한 강인성을 입증했다.
- 예측 신호의 레이블 밀도가 높을수록 포트폴리오 성과가 향상되었으며, 밀도 50% 및 정확도 70% 조건에서 DPM 대비 포트폴리오 가치가 90.3% 증가했다.
- SARL는 무작위로 시뮬레이션된 레이블로 훈련된 모델보다 뚜렷이 뛰어나, 실제 금융 뉴스에는 무작위 신호에는 존재하지 않는 이용 가능한 숨겨진 상관관계가 존재함을 보여주었다.
- SARL의 샤프 지수는 시간에 따라 DPM보다 항상 높게 유지되었으며, 손실 함수에 명시적인 리스크 정규화가 없음에도 불구하고 SARL가 리스크를 고려한 전략을 학습함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.