[论文解读] Risk-Sensitive Compact Decision Trees for Autonomous Execution in Presence of Simulated Market Response
本文提出了一种基于紧凑决策树的风险敏感强化学习框架,用于优化限价订单簿市场的高频订单执行。通过在基于历史订单流数据模拟市场冲击与响应的仿真环境中训练智能体,该方法在执行成本降低32%的同时,使成本方差增加27%,展现出相较于基准策略更优的风险调整后表现。
We demonstrate an application of risk-sensitive reinforcement learning to optimizing execution in limit order book markets. We represent taking order execution decisions based on limit order book knowledge by a Markov Decision Process; and train a trading agent in a market simulator, which emulates multi-agent interaction by synthesizing market response to our agent's execution decisions from historical data. Due to market impact, executing high volume orders can incur significant cost. We learn trading signals from market microstructure in presence of simulated market response and derive explainable decision-tree-based execution policies using risk-sensitive Q-learning to minimize execution cost subject to constraints on cost variance.
研究动机与目标
- 开发一种自主交易智能体,以最小化限价订单簿市场中的风险调整后执行成本。
- 基于历史订单流数据,利用数据驱动的仿真器对市场冲击与其他参与者的响应进行建模。
- 从风险敏感Q-learning中生成可解释的紧凑决策树策略,以实现现实世界中的部署。
- 通过风险敏感强化学习,在成本降低与成本方差之间实现平衡。
- 将基于决策树的智能体性能与传统非强化学习基准策略(如TWAP和VWAP)进行比较。
提出的方法
- 将问题建模为马尔可夫决策过程(MDP),其中状态变量源自限价订单簿特征与智能体持仓状态。
- 市场仿真器通过从历史数据中学习,合成多智能体市场响应,模拟其他参与者对激进交易的反应。
- 应用风险敏感Q-learning,采用一种成本函数,同时惩罚预期执行成本及其方差,由风险敏感参数β控制。
- 利用Hunt算法将所得Q值表转换为决策树,以实现可解释性与紧凑表示。
- 对状态变量进行离散化处理,划分为若干区间,以支持表格型Q-learning,区间边界的选择旨在平衡各状态的样本分布。
- 在仿真环境中训练并验证该框架,性能与非强化学习基准策略(如TWAP)进行比较。
实验结果
研究问题
- RQ1风险敏感强化学习能否提升限价订单簿交易中的执行成本与风险调整后表现?
- RQ2基于Q-learning生成的决策树策略与传统执行策略(如TWAP和VWAP)相比表现如何?
- RQ3模拟的市场响应在多大程度上能准确反映真实市场中多智能体的交互行为?
- RQ4紧凑且可解释的决策树能否有效表示通过强化学习学习到的复杂执行策略?
- RQ5在风险敏感学习下,成本降低与成本方差之间的权衡关系如何体现?
主要发现
- 基于强化学习的决策树智能体相比非强化学习基准策略,执行成本降低了32%。
- 该成本降低伴随着执行成本标准差27%的增加,反映出一种有意识的风险权衡。
- 仿真器成功利用历史数据模拟了市场对激进交易的响应,实现了对真实多智能体交互行为的建模。
- 决策树策略既紧凑又可解释,适合在算法交易系统中实际部署。
- 风险敏感Q-learning方法通过β参数有效平衡了成本最小化与方差控制。
- 结果表明,采用可解释策略表示的无模型强化学习,可在动态、具备冲击感知的环境中超越静态执行策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。