[论文解读] Aligning LLMs with Human Instructions and Stock Market Feedback in Financial Sentiment Analysis
本文提出了一种自适应检索增强型大语言模型框架,能够根据股票市场反馈动态调整知识源权重,从而提升金融情绪分析效果。通过指令微调、RAG以及直接/强化学习(RL)驱动的权重优化,对LLaMA 2模型进行微调,该方法在准确率和F1分数上提升了1%–6%,在牛市市场中生成的情绪驱动投资组合相较于标普500指数实现了3.61%更高的夏普比率,同时在熊市市场中将回撤降低了5倍。
Financial sentiment analysis is crucial for trading and investment decision-making. This study introduces an adaptive retrieval augmented framework for Large Language Models (LLMs) that aligns with human instructions through Instruction Tuning and incorporates market feedback to dynamically adjust weights across various knowledge sources within the Retrieval-Augmented Generation (RAG) module. Building upon foundational models like LLaMA 2, we fine-tune a series of LLMs ranging from 7B to 70B in size, enriched with Instruction Tuning and RAG, and further optimized through direct feedback and Reinforcement Learning (RL)-based refinement methods applied to the source weights of RAG.Through extensive evaluation, we demonstrate that the sentiment outputs from our LLMs more accurately mirror the intrinsic sentiment of textual data, showcasing a 1% to 6% boost in accuracy and F1 score over existing state-of-the-art models and leading conversational AI systems. Moreover, the sentiments extracted are more indicative of the directions in stock price movements. On top of that, we successfully construct portfolios that yield a 3.61% higher Sharpe ratio compared to the S&P 500 baseline in bullish markets. These portfolios also demonstrate resilience in bearish markets, with a 5x reduction in return losses compared to those typically experienced by the S&P 500.
研究动机与目标
- 通过将大语言模型与现实市场反馈对齐,提升情绪输出的预测准确性,以改进金融情绪分析。
- 解决静态RAG加权的局限性,提出基于市场反馈的动态、自适应知识源贡献调整机制。
- 研究模型规模(7B至70B参数)对金融场景下情绪分析性能的影响。
- 评估与市场回报对齐的情绪预测是否能生成更优的交易信号和投资组合表现。
- 减少对基于关键词检索的依赖,未来工作将探索语义搜索的集成。
提出的方法
- 该框架在推理过程中利用多个外部知识源的检索增强生成(RAG)技术,丰富大语言模型的上下文信息。
- RAG中的知识源权重通过后续股价变动的直接反馈或强化学习(RL)方法进行动态调整。
- 采用7B至70B参数的LLaMA 2变体大语言模型,通过指令微调和RAG技术进行微调,以增强金融情绪理解能力。
- 将市场反馈作为奖励信号,用于优化RAG权重,形成一个长期反馈循环,从而逐步提升情绪预测性能。
- 系统将情绪输出与实际市场回报进行对比,迭代优化信息源的加权分配。
- 未来工作将提出集成语义搜索功能,以替代基于关键词的检索,提升检索的相关性。
实验结果
研究问题
- RQ1如何通过基于现实市场反馈的自适应、非均匀加权机制,提升大语言模型RAG模块中多个知识源的权重分配?
- RQ2模型规模增大对大语言模型在金融情绪分析中性能的影响如何?
- RQ3将大语言模型与市场反馈对齐后,其情绪预测是否能更准确地反映近未来股价变动?
- RQ4在优化金融情绪分析任务的RAG性能方面,直接反馈与基于强化学习的权重优化方法相比有何差异?
- RQ5与市场对齐的大语言模型生成的情绪输出,能否产生具有可衡量风险调整收益的更优交易策略?
主要发现
- LLaMA I-RAG-RL模型在牛市市场中实现了2.3557的夏普比率,相比标普500基准(2.2736)提升了3.61%。
- 所有LLaMA投资组合在牛市市场中的累计收益均超过标普500基准,其中最先进模型展现出最强的风险调整表现。
- 在熊市市场(2022年),LLaMA投资组合的最大回撤相比标普500降低了5倍,展现出在市场下行周期中的强韧性。
- 经过优化的模型生成的情绪输出相比当前最先进模型及主流对话式AI系统,准确率和F1分数提升了1%–6%。
- 直接反馈方法在RAG权重优化中表现极为有效,基于强化学习的优化进一步提升了性能,尤其在市场波动剧烈时优势明显。
- 经优化的大语言模型生成的情绪预测对次日股价变动具有更强的预测能力,证实了市场对齐优化的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。