Skip to main content
QUICK REVIEW

[论文解读] Deep Stock Trading: A Hierarchical Reinforcement Learning Framework for Portfolio Optimization and Order Execution

Rundong Wang, Hongxin Wei|arXiv (Cornell University)|Dec 23, 2020
Advanced Bandit Algorithms Research参考文献 19被引用 4
一句话总结

该论文提出HRPM,一种分层强化学习框架,将投资组合管理与订单执行分离,以在最小化价格冲击等交易成本的同时优化长期回报。通过在时间窗口内训练高层策略进行再平衡、低层策略进行执行,HRPM在美中两国市场均显著优于现有最先进方法,实现48.7%的年化收益率及更优的风险调整指标。

ABSTRACT

Portfolio management via reinforcement learning is at the forefront of fintech research, which explores how to optimally reallocate a fund into different financial assets over the long term by trial-and-error. Existing methods are impractical since they usually assume each reallocation can be finished immediately and thus ignoring the price slippage as part of the trading cost. To address these issues, we propose a hierarchical reinforced stock trading system for portfolio management (HRPM). Concretely, we decompose the trading process into a hierarchy of portfolio management over trade execution and train the corresponding policies. The high-level policy gives portfolio weights at a lower frequency to maximize the long term profit and invokes the low-level policy to sell or buy the corresponding shares within a short time window at a higher frequency to minimize the trading cost. We train two levels of policies via pre-training scheme and iterative training scheme for data efficiency. Extensive experimental results in the U.S. market and the China market demonstrate that HRPM achieves significant improvement against many state-of-the-art approaches.

研究动机与目标

  • 解决现有强化学习方法在投资组合管理中忽略价格冲击且假设瞬时执行的局限性。
  • 通过构建两级决策流程(长期再平衡与短期执行)来模拟现实世界中投资经理与交易员的层级结构。
  • 通过低层策略的预训练及带熵正则化的迭代训练,提升数据效率与整体性能。
  • 通过实证验证该框架在多种市场环境(包括高波动环境)下的优越性。

提出的方法

  • HRPM将包含交易成本的投资组合管理建模为分层马尔可夫决策过程(HMDP),将长期投资组合权重决策与短期执行动作分离。
  • 高层策略以较低频率运行,用于确定最优投资组合权重,并触发低层策略执行订单。
  • 低层策略采用动作分支机制处理多维动作(买入/卖出数量与价格),并通过预训练与迭代微调方案进行训练。
  • 在高层策略中引入熵奖励,以促进投资组合分散化并降低风险敞口。
  • 该框架利用委托单簿数据,并将真实交易成本(包括冲击成本)整合进奖励函数。
  • 训练基于美国与中国股市的历史价格与委托单簿数据进行,以确保实际适用性。

实验结果

研究问题

  • RQ1分层强化学习框架能否有效解耦长期投资组合优化与短期订单执行,从而降低交易成本?
  • RQ2价格冲击是否为交易成本中不可忽视的组成部分,必须显式建模以实现真实性能?
  • RQ3在高层策略中引入熵奖励是否能改善风险分散化并提升整体投资组合稳定性?
  • RQ4HRPM在收益、风险调整绩效及不同市场周期下的鲁棒性方面,相较于最先进方法表现如何?
  • RQ5低层策略的预训练与迭代微调在多大程度上提升了数据效率与整体系统性能?

主要发现

  • 在中国市场,HRPM实现48.742%的年化收益率,较次佳基线方法(DPM)高出13%,较市场指数(SSE50)高出42%。
  • 在美国市场,HRPM在熵奖励系数η=0.05时实现27.089%的年化收益率,为所有测试配置中的最高值。
  • HRPM展现出卓越的风险控制能力,在美国市场实现最低最大回撤(MDD)0.117,并在高波动环境下保持强劲表现。
  • 消融实验表明,仅考虑佣金费用不足以捕捉总交易成本,其中冲击成本是主导因素,尤其在大额交易中更为显著。
  • 熵奖励显著提升了风险调整后收益,η=0.05时实现最高年化收益率(ARR),η=0.1时实现最低MDD,表明风险分散化效果良好。
  • 对低层策略行为的可视化分析显示,其能策略性地在价格高点卖出、在局部低点买入,有效降低不利价格影响,提升执行质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。