Skip to main content
QUICK REVIEW

[论文解读] Designing Heterogeneous LLM Agents for Financial Sentiment Analysis

Frank Xing|arXiv (Cornell University)|Jan 11, 2024
Topic Modeling参考文献 44被引用 4
一句话总结

本文提出了一种零样本、无需训练的框架——异质多智能体讨论(Heterogeneous multi-Agent Discussion, HAD),通过使用专注于特定错误类型的专用大语言模型(LLM)智能体,提升金融情感分析(FSA)的准确性,而无需微调。通过为每个智能体分配专注于特定错误类型(如情绪、修辞或指代)的角色,HAD 在智能体讨论充分时,相比简单提示工程显著提升了准确率,尤其在大幅缩小提示工程与微调模型之间的性能差距方面,实现了25–35%的改进。

ABSTRACT

Large language models (LLMs) have drastically changed the possible ways to design intelligent systems, shifting the focuses from massive data acquisition and new modeling training to human alignment and strategical elicitation of the full potential of existing pre-trained models. This paradigm shift, however, is not fully realized in financial sentiment analysis (FSA), due to the discriminative nature of this task and a lack of prescriptive knowledge of how to leverage generative models in such a context. This study investigates the effectiveness of the new paradigm, i.e., using LLMs without fine-tuning for FSA. Rooted in Minsky's theory of mind and emotions, a design framework with heterogeneous LLM agents is proposed. The framework instantiates specialized agents using prior domain knowledge of the types of FSA errors and reasons on the aggregated agent discussions. Comprehensive evaluation on FSA datasets show that the framework yields better accuracies, especially when the discussions are substantial. This study contributes to the design foundations and paves new avenues for LLMs-based FSA. Implications on business and management are also discussed.

研究动机与目标

  • 解决在不进行微调的情况下,利用生成式 LLM 进行金融情感分析(FSA)时缺乏明确设计知识的问题。
  • 通过模拟类人推理,利用专注于常见 LLM 错误类型的专用 LLM 智能体,提升 FSA 准确率。
  • 开发一种基于理论、无需训练的框架,其性能优于简单提示工程,并接近微调模型的表现。
  • 探索异质智能体协作在 FSA 中的有效性,特别是处理模糊性、专业术语和外部指代方面。
  • 为基于 LLM 的 FSA 提供一种可推广的设计理论,适用于多种数据集,并可应用于现实世界的金融决策场景。

提出的方法

  • 该框架采用五个异质 LLM 智能体,每个智能体被提示专注于一种特定错误类型:情绪、修辞、方面、指代和依存关系。
  • 每个智能体独立分析输入文本,基于其专业角色生成情感预测。
  • 通过共享的讨论机制聚合所有智能体的输出,最终结果由多数投票决定。
  • 该设计基于明斯基(Minsky)的心智与情感理论,将认知资源建模为具有专门功能的智能体。
  • 该框架为零样本设计,无需微调,完全依赖提示工程与智能体协作。
  • 评估使用了多个 FSA 数据集(如 StockSen、CMC、SEntFiN、FPB、FiQA),将 HAD 与简单提示工程和微调基线模型进行比较。

实验结果

研究问题

  • RQ1异质多智能体 LLM 框架是否能在不进行微调的情况下提升 FSA 准确率?
  • RQ2基于已知 LLM 错误类型的智能体专业化是否优于通用提示工程?
  • RQ3智能体讨论的深度如何影响最终情感预测的准确率?
  • RQ4哪些智能体角色(如情绪、修辞、指代)对性能提升贡献最大?
  • RQ5该框架是否能显著缩小零样本提示与微调模型之间的性能差距?

主要发现

  • HAD 在多个数据集上提升了 FSA 准确率,尤其在智能体讨论充分时,表现优于简单提示工程。
  • 该框架缩小了 25–35% 的零样本提示与微调模型之间的性能差距。
  • 情绪、修辞和方面智能体对性能提升贡献最大,而依存关系智能体反而降低性能,可被移除以优化效率。
  • 在模糊情境下,框架能正确识别中性情感,而简单提示工程常因细微的积极表达错误地将消息标记为正面。
  • 案例研究显示,HAD 有效解决了专业术语、外部指代和虚拟语气等挑战,纠正了单个 LLM 常见错误。
  • 该设计在多种数据集(包括 StockSen 和 SEntFiN 等新数据集)上表现有效,表明其具备良好的泛化能力与零样本迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。