Skip to main content
QUICK REVIEW

[论文解读] Sentiment and Knowledge Based Algorithmic Trading with Deep Reinforcement Learning

Abhishek Nan, Anandh Perumal|arXiv (Cornell University)|Jan 26, 2020
Stock Market Forecasting Methods被引用 13
一句话总结

本文提出了一种深度强化学习(DRL)框架,整合了股票价格时间序列、新闻标题情感分析以及知识图谱提取的隐式关系,以提升算法交易表现。通过结合知识图谱遍历获取的与公司相关的新闻情感得分与DRL,该智能体实现了显著更高的利润和夏普比率——例如,MSFT的夏普比率为2.432,优于随机策略和情感无关策略。

ABSTRACT

Algorithmic trading, due to its inherent nature, is a difficult problem to tackle; there are too many variables involved in the real world which make it almost impossible to have reliable algorithms for automated stock trading. The lack of reliable labelled data that considers physical and physiological factors that dictate the ups and downs of the market, has hindered the supervised learning attempts for dependable predictions. To learn a good policy for trading, we formulate an approach using reinforcement learning which uses traditional time series stock price data and combines it with news headline sentiments, while leveraging knowledge graphs for exploiting news about implicit relationships.

研究动机与目标

  • 通过将交易建模为强化学习问题,解决股票市场预测中可靠标注数据不足的问题。
  • 通过知识图谱遍历整合与公司相关的新闻标题情感信息,提升交易策略的学习效果。
  • 通过挖掘新闻事件与股票之间的隐式关系,超越显式提及,增强决策能力。
  • 基于真实世界数据,实证评估情感与知识图谱集成对交易表现的影响。
  • 证明结合时间序列数据、情感信息与关系知识,可实现更优的风险调整后收益。

提出的方法

  • 智能体使用深度Q网络(DQN)基于融合了股票价格趋势与情感得分的状态表示,学习最优的买入/卖出/持有动作。
  • 通过以目标股票为中心的知识图谱遍历,检索相关新闻标题,识别语义相关的实体与事件。
  • 对相关标题应用情感分析,生成情感得分,并将其作为输入特征输入DRL智能体。
  • 状态空间包括历史价格数据(例如,5日与50日平均开盘价)以及从新闻中提取的情感特征。
  • 设计自定义奖励函数,以激励利润最大化,同时惩罚过度风险,通过夏普比率与累计利润评估收益。
  • 使用距离阈值对知识图谱进行剪枝,以限制远距离或无关关系带来的噪声。

实验结果

研究问题

  • RQ1将新闻标题的情感信息整合到DRL智能体中,能否提升其在算法交易中的表现?
  • RQ2通过知识图谱利用隐式关系,能否增强智能体预测市场走势的能力?
  • RQ3与基线DRL模型相比,情感与关系知识的引入如何影响风险调整后收益?
  • RQ4智能体的表现在多大程度上依赖于通过知识图谱提取的新闻数据的质量与相关性?
  • RQ5基于时间序列、情感与关系数据联合训练的DRL智能体,能否优于仅使用价格数据或仅使用情感数据的模型?

主要发现

  • 整合情感与知识图谱数据的DRL智能体在微软(MSFT)上的夏普比率达2.432,显著优于随机策略(-2.249)与情感无关策略(-1.357)。
  • 对于亚马逊(AMZN),情感增强型智能体的夏普比率为2.212,表明其具备出色的風險調整後表現。
  • 包含情感数据的智能体在所有测试股票(MSFT、AMZN、TSLA)中实现了最高的累计利润,展现出卓越的盈利能力。
  • 情感无关智能体仍实现盈利,是由于MSFT整体呈上升趋势,但其-1.357的夏普比率揭示了其风险调整后决策能力差。
  • 随机策略在所有指标中表现最差,MSFT的夏普比率为-2.249,证实了学习型方法的价值。
  • 结果表明,情感与关系知识提供了超越价格趋势的有意义信号,尤其在波动性或事件驱动的市场中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。