[论文解读] Double Deep Q-Learning for Optimal Execution
本文提出了一种用于最优交易执行的双深度Q学习(DDQN)框架,采用全连接神经网络从限价订单簿特征、交易信号和动作空间中估计Q值。该方法在九只股票中的七只上优于TWAP基准,表现出更高的中位数和均值超额收益,改善了盈亏比,并且在多个标的资产上超过95%的概率优于TWAP。
Optimal trade execution is an important problem faced by essentially all traders. Much research into optimal execution uses stringent model assumptions and applies continuous time stochastic control to solve them. Here, we instead take a model free approach and develop a variation of Deep Q-Learning to estimate the optimal actions of a trader. The model is a fully connected Neural Network trained using Experience Replay and Double DQN with input features given by the current state of the limit order book, other trading signals, and available execution actions, while the output is the Q-value function estimating the future rewards under an arbitrary action. We apply our model to nine different stocks and find that it outperforms the standard benchmark approach on most stocks using the measures of (i) mean and median out-performance, (ii) probability of out-performance, and (iii) gain-loss ratios.
研究动机与目标
- 开发一种无需依赖严格参数假设的模型无关强化学习方法,用于最优执行。
- 将深度Q学习与双DQN及经验回放相结合,以处理限价订单簿的连续状态与动作空间。
- 利用真实市场数据在多只股票上评估与标准TWAP基准的性能表现。
- 评估在状态表示中引入二次变差(QV)作为波动率代理变量的影响。
- 提供一种具有金融可解释性的策略,使其在不同市场状态和股票特征下具有泛化能力。
提出的方法
- 使用全连接深度神经网络训练以估计从状态-动作对到预期累计收益的Q值函数。
- 状态表示包括时间、持仓量、中间价、买卖价差以及二次变差(QV)作为特征。
- 采用双DQN以减少Q值估计中的过度估计偏差,提升学习稳定性。
- 使用经验回放以打破时间相关性,并在训练过程中提高数据效率。
- 动作空间由离散的执行数量构成,智能体在每一步选择估计Q值最大的动作。
- 通过存储(状态,动作,奖励,下一状态)转换的回放缓冲区训练网络,并采用目标网络更新以增强稳定性。
实验结果
研究问题
- RQ1是否能够通过深度强化学习方法在不依赖参数化价格模型的前提下,优于标准的TWAP基准?
- RQ2将二次变差(QV)作为波动率特征纳入后,对所学习的交易策略及性能有何影响?
- RQ3DDQN模型在不同流动性与波动率的股票之间具有多大程度的泛化能力?
- RQ4所学习的策略在多大程度上符合已知的经济直觉,例如:随着持仓量增加或剩余时间减少,执行速度是否上升?
- RQ5状态表示(如时间、价格、持仓量、QV)对策略稳健性与超额表现有何影响?
主要发现
- 基于DDQN的策略在九只测试股票中的七只上优于TWAP,中位数和均值相对收益的超额表现具有统计显著性。
- 对于INTC,中位数超额表现分别达到11.63基点(TIP)和11.96基点(TIPQV),优于TWAP的概率分别为95.8%和97.8%。
- 对于VOD,中位数超额表现分别达到14.68基点(TIP)和15.72基点(TIPQV),优于TWAP的概率分别为97.8%和99.2%。
- 将QV作为特征通常能提升性能,表现为更高的中位数超额表现和盈亏比,尤其在高波动率市场环境中更为明显。
- 该策略表现出符合经济直觉的行为:执行速度随时间、价格和波动率(QV)增加而上升,随剩余持仓量减少而下降。
- 仅亚马逊和谷歌未表现出对TWAP的显著改进,其绩效指标接近或低于零,表明在低流动性或高噪声环境中收益有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。