[논문 리뷰] Cost-Sensitive Portfolio Selection via Deep Reinforcement Learning
이 논문은 가격 패턴과 자산 상관관계를 포착하기 위해 이중 스트림 신경망을 사용하고, 거래 및 리스크 비용을 제약하면서 수익을 최적화하기 위해 새로운 비용 민감도 보상 함수를 통합한 비용 민감도 포트폴리오 선택을 위한 딥 강화학습 프레임워크를 제안한다. 실세계 암호화폐 및 주식 데이터셋에서 뛰어난 수익성과 비용 민감도를 달성하였으며, 이론적 분석을 통해 근사 최적의 성장률을 보여주었다.
Portfolio Selection is an important real-world financial task and has attracted extensive attention in artificial intelligence communities. This task, however, has two main difficulties: (i) the non-stationary price series and complex asset correlations make the learning of feature representation very hard; (ii) the practicality principle in financial markets requires controlling both transaction and risk costs. Most existing methods adopt handcraft features and/or consider no constraints for the costs, which may make them perform unsatisfactorily and fail to control both costs in practice. In this paper, we propose a cost-sensitive portfolio selection method with deep reinforcement learning. Specifically, a novel two-stream portfolio policy network is devised to extract both price series patterns and asset correlations, while a new cost-sensitive reward function is developed to maximize the accumulated return and constrain both costs via reinforcement learning. We theoretically analyze the near-optimality of the proposed reward, which shows that the growth rate of the policy regarding this reward function can approach the theoretical optimum. We also empirically evaluate the proposed method on real-world datasets. Promising results demonstrate the effectiveness and superiority of the proposed method in terms of profitability, cost-sensitivity and representation abilities.
연구 동기 및 목표
- 기존 방법이 수작업 특징에 의존함에 따라 성능이 제한되는 비정상적인 가격 시계열과 복잡한 자산 상관관계 문제를 해결하기 위해.
- 이전 연구에서 종종 간과되거나 별도로 다뤄지는 거래 비용과 리스크 비용을 동시에 제어하기 위해.
- 효과적인 표현과 최적의 거래 정책을 종합적으로 학습하는 강화학습 기반 프레임워크를 개발하기 위해.
- 제안된 보상 함수가 자본 성장률을 최대화하는 데 있어 근사 최적성의 이론적 근거를 제공하기 위해.
- 실제 금융 데이터셋에서 수익성, 비용 민감도, 표현 학습 능력 면에서 본 방법의 열등함을 실증적으로 검증하기 위해.
제안 방법
- 이중 스트림 신경망 아키텍처를 제안한다: 한 스트림은 1D-CNN를 사용해 순차적 가격 데이터를 처리하여 시간적 패턴을 추출하고, 다른 스트림은 그래프 컬러션 네트워크(GCN)를 통해 자산 상관관계 행렬을 처리하여 상호 자산 의존성을 모델링한다.
- 두 스트림은 시장 상태의 통합 표현을 생성하며, 이는 정책 네트워크에 의해 포트폴리오 가중치를 출력하는 데 사용된다.
- 누적 수익을 극대화하면서 거래 비용(회전율 기반)과 리스크(변동성 기반)를 모두 페널티 처리하는 새로운 비용 민감도 보상 함수를 설계하여 실용적 성능의 직접 최적화를 가능하게 하였다.
- 정책은 DDPG에 듀얼링 Q-네트워크를 적용한 액터-크리틱 강화학습 알고리즘을 사용해 훈련되었으며, 훈련 안정성을 향상시켰다.
- 이 방법은 마르코프 결정 과정(MDP)으로 공식화되었으며, 상태는 이전 가격 시퀀스와 상관 구조로 정의된다.
- 이론적 분석을 통해 제안된 보상 함수 하에서 정책의 성장률이 이론적 최적에 가까워질 수 있음을 증명하여 근사 최적성의 타당성을 입증하였다.
실험 결과
연구 질문
- RQ1딥 강화학습 프레임워크는 비정상적인 가격 시계열과 자산 상관관계의 의미 있는 표현을 포트폴리오 선택 과정에서 효과적으로 학습할 수 있는가?
- RQ2단일 보상 함수가 동적 포트폴리오 관리에서 수익, 거래 비용, 리스크 노출을 동시에 최적화할 수 있는가?
- RQ3제안된 이중 스트림 아키텍처는 수작업 특징 또는 단일 스트림 표현을 사용하는 모델보다 수익성과 비용 통제 면에서 뛰어나게 성능을 발휘하는가?
- RQ4비용 제약 하에서 학습된 정책의 성능은 이론적 최적 성장률에 얼마나 가까운가?
- RQ5이 방법은 암호화폐 및 주식과 같은 다양한 금융 시장에 일반화되는가?
주요 결과
- Crypto-A 데이터셋에서 제안된 PPN 방법은 연간 포트폴리오 가치(APV) 32.04%를 기록하여 PPN-AC(11.72%) 및 기타 베이스라인을 크게 앞섰다.
- Crypto-A에서 PPN 방법은 최대 손실(MMD)을 38.86%로 줄였으며, PPN-AC의 60.25% 대비 더 나은 리스크 통제를 보였다.
- S&P500 데이터셋에서 방법은 표준편차 2.16%를 동반한 APV 32.04%를 기록하여 20개의 랜덤 시드에서 안정성과 강건성을 입증하였다.
- PPN-AC 대비 거래 비용을 79.87% 감소시켜 비용 민감도 보상 함수의 효과성을 확인하였다.
- 이중 스트림 아키텍처는 단일 스트림 모델을 능가하는 6.85%의 샤프 지수를 기록하여 가격 패턴과 상관관계의 통합 학습의 중요성을 입증하였다.
- 이론적 분석을 통해 제안된 보상 함수 하에서 정책의 성장률이 이론적 최적에 가까워질 수 있음을 확인하여 근사 최적성의 타당성을 검증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.