[论文解读] QuantAgent: Seeking Holy Grail in Trading by Self-Improving Large Language Model
本文提出 QuantAgent,一种基于大语言模型的自改进型自主量化交易代理,采用双环框架以迭代方式优化金融信号生成。通过将知识库优化的内环与现实世界回测的外环相结合,该代理能自主提升信号质量与预测准确性,随时间推移在信息系数(IC)和夏普比率方面均取得显著改进。
Autonomous agents based on Large Language Models (LLMs) that devise plans and tackle real-world challenges have gained prominence.However, tailoring these agents for specialized domains like quantitative investment remains a formidable task. The core challenge involves efficiently building and integrating a domain-specific knowledge base for the agent's learning process. This paper introduces a principled framework to address this challenge, comprising a two-layer loop.In the inner loop, the agent refines its responses by drawing from its knowledge base, while in the outer loop, these responses are tested in real-world scenarios to automatically enhance the knowledge base with new insights.We demonstrate that our approach enables the agent to progressively approximate optimal behavior with provable efficiency.Furthermore, we instantiate this framework through an autonomous agent for mining trading signals named QuantAgent. Empirical results showcase QuantAgent's capability in uncovering viable financial signals and enhancing the accuracy of financial forecasts.
研究动机与目标
- 解决在量化金融领域为大语言模型代理构建和整合高质量领域特定知识库的挑战。
- 实现代理通过闭环系统实现自主改进,最大限度减少人工干预。
- 开发一种系统化框架,系统性地评估并增强大语言模型代理中的知识整合。
- 展示该框架在挖掘高质量、可操作金融信号方面的有效性。
- 通过理论分析与实证评估,验证自改进机制的收敛性与效率。
提出的方法
- 该框架采用双层循环:内环用于基于领域特定知识库的迭代响应优化,外环通过回测实现现实世界评估。
- 代理基于交易理念生成金融信号,每个信号均存储于知识库中,包含实现细节、绩效指标及专家评审。
- 自改进由现实世界回测的反馈驱动,自动将新验证的洞察加入知识库。
- 理论分析将该过程建模为马尔可夫决策过程,在特定假设下证明其收敛至最优行为。
- 通过信息系数(IC)、夏普比率、实体覆盖率及基于 GPT-4 的成对相关性比较等指标评估信号质量。
- 系统使用 XGBoost 回归模型评估来自动态演化知识库的信号的预测能力。

实验结果
研究问题
- RQ1大语言模型代理能否通过迭代式自我优化实现金融信号生成的自主改进?
- RQ2内环(知识库优化)与外环(现实世界回测)的结合在多大程度上提升了信号质量与预测准确性?
- RQ3在无需大量人工干预的情况下,代理的知识库在多大程度上能演化以支持更精准的金融预测?
- RQ4在所提出的框架下,自改进机制的理论收敛行为如何?
- RQ5关键信号质量指标(如 IC、夏普比率及与交易理念的相关性)随时间如何演变?
主要发现
- 随着累积阿尔法数量的增加,代理在预测准确性方面表现出持续改进,均方误差(MSE)误差呈下降趋势。
- 代理生成的信号的信息系数(IC)呈现可测量的上升趋势,表明其预测能力随时间增强。
- 通过自改进,信号的夏普比率显著提升,反映出更强的风险调整后收益。
- 基于 GPT-4 评估的胜率矩阵显示明确趋势,即相关性提高,矩阵右上角表明信号与其底层交易理念的对齐程度更强。
- 外环对信号质量的贡献显著高于仅使用内环,且内外环结合的性能最高,如图 4 右侧矩阵所示的递减模式所证实。
- 代理成功构建了一个全面且高质量的信号知识库,通过自主、迭代式学习实现更精准的金融预测。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。