Skip to main content
QUICK REVIEW

[论文解读] Deep reinforcement learning for time series: playing idealized trading games

Xiang Gao|arXiv (Cornell University)|Mar 11, 2018
Stock Market Forecasting MethodsDecision Sciences参考文献 19被引用 17
一句话总结

该论文应用深度强化学习,具体为结合LSTM、GRU、CNN和MLP架构的深度Q网络(DQN),在两种理想化的时间序列环境中学习最优交易策略:单变量(波浪状价格)和双变量(价格加相关噪声信号)。在单变量游戏中,基于GRU的智能体表现优于其他模型;在双变量游戏中,基于MLP的智能体表现最佳,表明其能有效从时间序列输入中学习策略。

ABSTRACT

Deep Q-learning is investigated as an end-to-end solution to estimate the optimal strategies for acting on time series input. Experiments are conducted on two idealized trading games. 1) Univariate: the only input is a wave-like price time series, and 2) Bivariate: the input includes a random stepwise price time series and a noisy signal time series, which is positively correlated with future price changes. The Univariate game tests whether the agent can capture the underlying dynamics, and the Bivariate game tests whether the agent can utilize the hidden relation among the inputs. Stacked Gated Recurrent Unit (GRU), Long Short-Term Memory (LSTM) units, Convolutional Neural Network (CNN), and multi-layer perceptron (MLP) are used to model Q values. For both games, all agents successfully find a profitable strategy. The GRU-based agents show best overall performance in the Univariate game, while the MLP-based agents outperform others in the Bivariate game.

研究动机与目标

  • 探究深度强化学习是否能在无需领域特定特征工程的情况下,从时间序列输入中学习到盈利的交易策略。
  • 评估不同深度神经网络架构(GRU、LSTM、CNN和MLP)在建模交易中序列决策的Q值函数方面的有效性。
  • 测试智能体是否能从与未来价格走势相关的噪声信号中发现隐藏模式。
  • 在两种受控环境中比较模型表现:一种仅包含价格动态,另一种包含信息性信号。

提出的方法

  • 本研究采用深度Q网络(DQN)框架,结合多种循环和前馈神经网络架构,从时间序列观测中估计Q值。
  • 在单变量游戏中,输入为波浪状价格序列;在双变量游戏中,输入包括阶梯状价格序列和相关噪声信号。
  • 使用堆叠的门控循环单元(GRUs)、长短期记忆单元(LSTMs)、卷积神经网络(CNNs)和多层感知机(MLPs)来建模Q值函数。
  • 通过经验回放和目标网络稳定强化学习框架中的学习过程。
  • 训练在模拟环境中进行,智能体根据累积投资组合回报获得奖励。
  • 基于多次训练运行的最终累积回报及其一致性来评估各智能体的性能。

实验结果

研究问题

  • RQ1深度强化学习智能体是否能从原始时间序列数据中学习到盈利的交易策略,而无需显式特征工程?
  • RQ2在从时间序列输入学习最优策略方面,不同神经网络架构(GRU、LSTM、CNN和MLP)的表现如何比较?
  • RQ3在双变量交易环境中,智能体是否能利用与未来价格变动正相关的隐藏噪声信号?
  • RQ4智能体的表现是否依赖于时间序列的底层结构,如周期性或噪声水平?
  • RQ5哪种架构在不同时间序列动态下能产生最稳健且盈利的策略?

主要发现

  • 在单变量游戏中,基于GRU的智能体实现了最高的累积回报,表明其在建模周期性价格动态方面具有优越能力。
  • 在双变量游戏中,基于MLP的智能体表现优于所有其他架构,表明其有效捕捉了信号与噪声之间的关系。
  • 所有智能体架构在两种游戏中均成功学习到盈利策略,表明DQN框架在时间序列决策任务中具有强大鲁棒性。
  • 在单变量设置中,与前馈网络相比,使用堆叠GRUs和LSTMs显著提升了时间建模能力。
  • 在双变量游戏中引入相关噪声信号显著提升了性能,证实智能体能够从不完美信号中提取有用信息。
  • 结果表明,端到端的深度强化学习可直接从原始时间序列输入中发现非平凡的交易策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。