Skip to main content
QUICK REVIEW

[论文解读] FinRL-DeepSeek: LLM-Infused Risk-Sensitive Reinforcement Learning for Trading Agents

Mostapha Benhenda|ArXiv.org|Feb 11, 2025
FinTech, Crowdfunding, Digital Finance被引用 9
一句话总结

该论文提出一个风险敏感的交易代理,通过将 CVaR-PPO 与来自 LLM 的股票推荐以及来自金融新闻的风险信号结合,在 Nasdaq-100 上使用多种 LLM 进行评估。

ABSTRACT

This paper presents a novel risk-sensitive trading agent combining reinforcement learning and large language models (LLMs). We extend the Conditional Value-at-Risk Proximal Policy Optimization (CPPO) algorithm, by adding risk assessment and trading recommendation signals generated by a LLM from financial news. Our approach is backtested on the Nasdaq-100 index benchmark, using financial news data from the FNSPID dataset and the DeepSeek V3, Qwen 2.5 and Llama 3.3 language models. The code, data, and trading agents are available at: https://github.com/benstaf/FinRL_DeepSeek

研究动机与目标

  • 将金融新闻作为风险与推荐信号纳入强化学习以用于交易。
  • 扩展 CPPO 以 CVaR 约束来管理交易轨迹中的下行风险。
  • 展示从新闻中基于 LLM 的特征提取超越情感分析以用于交易决策。

提出的方法

  • 在 CVaR-PPO 中加入 LLM 推送的股票推荐与风险分数。
  • 从 LLM 的股票分数中注入动作扰动 S_f 以调节交易信号。
  • 从 LLM 派生的新闻风险分数中注入风险扰动 R_f 来调整轨迹回报(D_Rf = R_f * D)。
  • 使用每只股票每天的 FNSPID 新闻的代表性采样来为三个 LLM 生成提示(DeepSeek-V3、Qwen 2.5、Llama 3.3)。
  • 在 Nasdaq-100 上对 2019–2023 年历史窗口进行回测,并评估 PPO/CPPO 及其 DeepSeek 变体在信息比率、CVaR 与 Rachev 比率方面的表现。

实验结果

研究问题

  • RQ1LLM 推送的股票推荐与风险分数是否能在超越标准 PPO/CPPO 基线的同时提升风险敏感的 RL 交易表现?
  • RQ2在 PPO-DeepSeek 与 CPPO-DeepSeek 配置中,不同的 LLM 注入强度对交易表现有何影响?
  • RQ3在更长的训练时长下,当引入 LLM 信号时,表现是否会稳定并提升?
  • RQ4基于 LLM 的风险信号如何影响交易中的 CVaR 约束学习目标?

主要发现

  • LLM 融合的 PPO/CPPO 在更长的训练期内显示出累积回报的提升,但在某些设定下仍可能落后于 Nasdaq-100。
  • 在 2M 训练步长下,PPO-DeepSeek 与 CPPO-DeepSeek 变体在各轮次获得显著的信息比率与 CVaR 指标,在熊市中有时甚至超过 Nasdaq-100。
  • 更强的 LLM 注入通常会降低 PPO 的表现,但在某些轮次中提升 CPPO-DeepSeek 的表现,表明效果取决于模型与模式。
  • PPO-DeepSeek 在牛市中往往表现出色,而 CPPO-DeepSeek 在熊市中具有优势,出现在两次运行中。
  • 注入强度实验表明,10% 注入在某些配置下通常对 PPO-DeepSeek 不利,而 CPPO-DeepSeek 在某些配置下可受益于更高的注入。
  • 表格显示:PPO (100 epochs) Information Ratio 0.0100, CVaR -0.0394, Rachev 1.0637; CPPO (100 epochs) -0.0148, -0.0439, 1.0404; PPO-DeepSeek (100 epochs) -0.0093, -0.0338, 0.9890; CPPO-DeepSeek (100 epochs) 0.0078, -0.0437, 0.9818。
  • S_f 和 R_f 扰动影响交易行动和风险调整收益,近似为 1 的扰动可以在保持稳定性的同时与新闻信号对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。