Skip to main content
QUICK REVIEW

[论文解读] Deep Learning for Financial Time Series: A Large-Scale Benchmark of Risk-Adjusted Performance

Adir Saly-Kaufmann, Kieran Wood|arXiv (Cornell University)|Mar 2, 2026
Stock Market Forecasting Methods被引用 0
一句话总结

一个大规模基准测试评估多种深度学习架构在为夏普比率优化的金融时间序列预测中的表现,强调具备显式时间表示和自适应记忆的架构(如 VLSTM、LPatchTST、TFT)在风险调整标准下优于线性基线和通用 DL 模型。

ABSTRACT

We present a large scale benchmark of modern deep learning architectures for a financial time series prediction and position sizing task, with a primary focus on Sharpe ratio optimization. Evaluating linear models, recurrent networks, transformer based architectures, state space models, and recent sequence representation approaches, we assess out of sample performance on a daily futures dataset spanning commodities, equity indices, bonds, and FX spanning 2010 to 2025. Our evaluation goes beyond average returns and includes statistical significance, downside and tail risk measures, breakeven transaction cost analysis, robustness to random seed selection, and computational efficiency. We find that models explicitly designed to learn rich temporal representations consistently outperform linear benchmarks and generic deep learning models, which often lead the ranking in standard time series benchmarks. Hybrid models such as VSN with LSTM, a combination of Variable Selection Networks (VSN) and LSTMs, achieves the highest overall Sharpe ratio, while VSN with xLSTM and LSTM with PatchTST exhibit superior downside adjusted characteristics. xLSTM demonstrates the largest breakeven transaction cost buffer, indicating improved robustness to trading frictions.

研究动机与目标

  • 在跨资产期货数据集(2010–2025)上评估现代深度学习架构的样本外风险调整性能。
  • 研究架构性归纳偏置(时间表示、记忆、特征选择)如何影响夏普比率优化与线性基线的比较。
  • 评估稳定性、下行风险,以及对随机种子与市场阶段的鲁棒性。
  • 提供一个透明、实用的基准,为未来金融领域深度学习研究提供指引。

提出的方法

  • 框架通过两阶段管道将历史多变量输入映射到交易信号:序列模型 g_phi 处理回看窗口以产生潜在状态 h_t,然后通过带有 tanh 激活的线性投影得到 y_hat_t。
  • 投资组合权重通过将信号按基于 EWMA 的各资产波动率的波动率目标因子进行缩放来实现目标风险(sigma_tgt = 10%)。
  • 端到端训练通过评估训练序列中的投资组合收益 R_port 并应用带稳定项 epsilon 的夏普损失,优化负的年化夏普比率。
  • 净收益包含交易成本;主要评估使用毛收益(c_k = 0)来评估预测效果,随后对各资产进行扭亏为盈的交易成本分析。
  • 模型家族包括线性基线(AR1x、AR_n x、DLinear、NLinear)、基于 Transformer 的架构(iTransformer、PatchTST)、状态空间模型(Mamba、Mamba2)、循环模型(LSTM、xLSTM、PsLSTM、PatchPsLSTM)以及混合模型(VLSTM、VSN+Mamba2、LPatchTST、TFT)。
  • 注:管道还包含股票代码嵌入和跨资产归一化,以确保资产特定学习。)

实验结果

研究问题

  • RQ1在一个长期、跨资产的金融时间序列 setting 中,哪些深度学习架构在风险调整(夏普)方面表现最佳?
  • RQ2架构性归纳偏置(时间表示、记忆机制、特征选择)如何影响在不同阶段的稳定性和对交易摩擦的鲁棒性?
  • RQ3混合和结构化模型(如 VLSTM、LPatchTST、TFT)在下行风险和尾部行为方面是否优于线性基线和通用 DL 模型?
  • RQ4在波动率目标下,预测性能与交易强度(换手率)之间的权衡如何?
  • RQ5结果在 2010–2025 的市场阶段及不同子时期的泛化性如何?

主要发现

  • 非线性序列模型在大多数时间尺度上显著超越线性基线,且风险调整收益更强、更稳定。
  • VLSTM 在整体表现上最强(Sharpe 2.39,CAGR 23.9%),具有鲁棒的被动相对诊断(Info. Ratio 0.854;HAC t-stat 3.31)。
  • LPatchTST 与 TFT 也表现出色,体现了将鲁棒的时间状态编码与基于 Patch 的或注意力机制结合的优势。
  • 基于 xLSTM 的架构在性能与交易效率之间取得有利平衡(Sharpe 1.80;换手率相对适中)。
  • iTransformer 显示出较低的换手率但经济性能薄弱,强调在信号响应不足的情况下极端降低换手率可能削弱价值。
  • 在所有方法中,结合特征选择与自适应记忆的混合模型(如 VLSTM、LPatchTST)实现更高的夏普比率和更好的风险控制。
  • 状态空间模型(Mamba、Mamba2)结果呈现异质性,总体综合表现通常较低,尽管在某些阶段存在强烈的阶段性表现。
  • 在波动率目标框架下,VLSTM 实现最高的 CAGR 与夏普比率,并相对被动基准具有显著统计意义。
  • 下行风险指标对 VLSTM 与 LPatchTST 更为有利,显示较温和的回撤和对 Calmar 比率的有利表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。