[论文解读] Cost-Sensitive Portfolio Selection via Deep Reinforcement Learning
本文提出了一种用于成本敏感型投资组合选择的深度强化学习框架,采用双流神经网络捕捉价格模式与资产相关性,并结合一种新颖的成本敏感型奖励函数,以在控制交易成本和风险成本的同时优化收益。该方法在真实世界加密货币与股票数据集上实现了卓越的盈利能力和成本敏感性,理论分析表明其增长速率接近最优。
Portfolio Selection is an important real-world financial task and has attracted extensive attention in artificial intelligence communities. This task, however, has two main difficulties: (i) the non-stationary price series and complex asset correlations make the learning of feature representation very hard; (ii) the practicality principle in financial markets requires controlling both transaction and risk costs. Most existing methods adopt handcraft features and/or consider no constraints for the costs, which may make them perform unsatisfactorily and fail to control both costs in practice. In this paper, we propose a cost-sensitive portfolio selection method with deep reinforcement learning. Specifically, a novel two-stream portfolio policy network is devised to extract both price series patterns and asset correlations, while a new cost-sensitive reward function is developed to maximize the accumulated return and constrain both costs via reinforcement learning. We theoretically analyze the near-optimality of the proposed reward, which shows that the growth rate of the policy regarding this reward function can approach the theoretical optimum. We also empirically evaluate the proposed method on real-world datasets. Promising results demonstrate the effectiveness and superiority of the proposed method in terms of profitability, cost-sensitivity and representation abilities.
研究动机与目标
- 为解决现有方法依赖手工特征时在投资组合选择中面临的非平稳价格序列与复杂资产相关性问题,这些因素限制了其性能。
- 在投资组合决策中同时控制交易成本与风险成本,而这些成本在以往研究中常被忽略或分别处理。
- 开发一种基于强化学习的框架,端到端学习有效表征与最优交易策略。
- 从理论上证明所提出的奖励函数在最大化财富增长速率方面的近似最优性。
- 在真实金融数据集上实证验证该方法在盈利性、成本敏感性与表征学习方面的优越性。
提出的方法
- 提出一种双流神经网络架构:一路使用一维卷积神经网络(1D-CNN)处理序列价格数据以提取时间模式,另一路通过图卷积网络(GCN)处理资产相关性矩阵,以建模跨资产依赖关系。
- 将两路特征融合,生成市场状态的联合表征,由策略网络据此输出投资组合权重。
- 设计一种新颖的成本敏感型奖励函数,旨在最大化累积收益,同时对交易成本(基于换手率)与风险(基于波动率)进行惩罚,从而实现对实际性能的直接优化。
- 采用演员-评论家强化学习算法(具体为DDPG结合双值Q网络)训练策略,以提升训练稳定性。
- 将方法形式化为马尔可夫决策过程(MDP),其中状态由历史价格序列与相关性结构定义。
- 理论分析证明,在所提出的奖励函数下,策略的增长速率可趋近理论最优值,从而确保其近似最优性。
实验结果
研究问题
- RQ1深度强化学习框架能否有效学习非平稳价格序列与资产相关性在投资组合选择中的有意义表征?
- RQ2单一奖励函数能否在动态投资组合管理中同时优化收益、交易成本与风险敞口?
- RQ3所提出的双流架构是否在盈利性与成本控制方面优于使用手工特征或单流表征的模型?
- RQ4所学策略的性能在成本约束下与理论最优增长速率有多接近?
- RQ5该方法是否在不同金融市场(如加密货币与股票)中具有泛化能力?
主要发现
- 在Crypto-A数据集上,所提出的PPN方法实现了32.04%的年化投资组合价值(APV),显著优于PPN-AC的11.72%及其他基线方法。
- 在Crypto-A数据集上,PPN方法将最大回撤(MMD)降低至38.86%,而PPN-AC为60.25%,表明其具备更优的风险控制能力。
- 在S&P500数据集上,该方法实现了32.04%的APV与2.16%的标准差,表明其在20组随机种子下均表现出稳健性与稳定性。
- 与PPN-AC相比,该方法将交易成本降低了79.87%,证实了成本敏感型奖励函数的有效性。
- 双流架构实现了6.85%的夏普比率,优于单流模型,凸显了联合学习价格模式与相关性的重要性。
- 理论分析确认,在所提出的奖励函数下,策略的增长速率可趋近理论最优值,验证了其近似最优性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。