[論文レビュー] Designing Heterogeneous LLM Agents for Financial Sentiment Analysis
本稿では、微調整を必要としないゼロショットで訓練フリーなフレームワークであるHeterogeneous multi-Agent Discussion (HAD)を提案する。HADは、特定のエラー種別(感情、修辞、参照など)に特化した大規模言語モデル(LLM)エージェントを用いて、微調整なしで金融センチメント分析(FSA)の精度を向上させる。エージェント同士の議論が活発な場合、特に、プロンプティングと微調整の間の性能ギャップの25–35%を埋めることが可能で、ナーヴィなプロンプティングより高い精度を達成する。
Large language models (LLMs) have drastically changed the possible ways to design intelligent systems, shifting the focuses from massive data acquisition and new modeling training to human alignment and strategical elicitation of the full potential of existing pre-trained models. This paradigm shift, however, is not fully realized in financial sentiment analysis (FSA), due to the discriminative nature of this task and a lack of prescriptive knowledge of how to leverage generative models in such a context. This study investigates the effectiveness of the new paradigm, i.e., using LLMs without fine-tuning for FSA. Rooted in Minsky's theory of mind and emotions, a design framework with heterogeneous LLM agents is proposed. The framework instantiates specialized agents using prior domain knowledge of the types of FSA errors and reasons on the aggregated agent discussions. Comprehensive evaluation on FSA datasets show that the framework yields better accuracies, especially when the discussions are substantial. This study contributes to the design foundations and paves new avenues for LLMs-based FSA. Implications on business and management are also discussed.
研究の動機と目的
- 微調整を伴わない生成的LLMを金融センチメント分析(FSA)に活用するための指示的設計知識の欠如に対処すること。
- 既知のLLMのエラー種別に特化した専用のLLMエージェントを用いて、人間の類似推論を模倣することでFSAの精度を向上させること。
- 理論を根拠にした訓練フリーなフレームワークを構築し、ナーヴィなプロンプティングを上回り、微調整済みモデルに近い性能を達成すること。
- 特に曖昧さ、専門用語、外部参照の処理に注目し、異種エージェント間の協働の有効性を検証すること。
- 汎用的で実世界の金融意思決定文脈に応用可能な、LLMベースのFSAの設計理論を貢献すること。
提案手法
- フレームワークは、それぞれが異なるエラー種別(感情、修辞、側面、参照、依存関係)に特化した5つの異種LLMエージェントを採用する。
- 各エージェントは入力テキストを独立して分析し、その専門的役割に基づいてセンチメント予測を生成する。
- 共有の議論メカニズムが全エージェントの出力を集約し、過半数による合意で最終予測を決定する。
- 設計はミンスキーの心と感情の理論に基づき、認知リソースを専門的役割を持つエージェントとしてモデル化する。
- フレームワークはゼロショットであり、微調整を一切必要とせず、プロンプト工学とエージェント協働に依存する。
- 評価には複数のFSAデータセット(例:StockSen, CMC, SEntFiN, FPB, FiQA)を用い、HADをナーヴィなプロンプティングおよび微調整済みベースラインと比較する。
実験結果
リサーチクエスチョン
- RQ1異種マルチエージェントLLMフレームワークは、微調整なしでFSAの精度を向上させることができるか?
- RQ2既知のLLMエラー種別に基づくエージェントの特化は、一般的なプロンプティングよりも優れた性能をもたらすか?
- RQ3エージェント間の議論の深さは、最終的なセンチメント予測の精度にどのように影響するか?
- RQ4どのエージェント役割(例:感情、修辞、参照)が性能向上に最も寄与しているか?
- RQ5このフレームワークは、ゼロショットプロンプティングと微調整済みモデルの間の性能ギャップの顕著な部分を埋めることができるか?
主な発見
- HADは複数のデータセットでFSAの精度を向上させ、特にエージェント間の議論が活発な場合、ナーヴィなプロンプティングを上回る。
- フレームワークはゼロショットプロンプティングと微調整済みモデルの間の性能ギャップの25–35%を埋めている。
- 感情、修辞、側面エージェントが性能向上に最も寄与しており、依存関係エージェントは性能を低下させるため、最適化のためには削除可能である。
- フレームワークは、微細な肯定的表現によってナーヴィなプロンプティングが誤ってポジティブと判断する曖昧なケースにおいても、ニュートラルなセンチメントを正しく特定する。
- 事例研究では、HADが専門用語、外部参照、非現実的態(irrealis mood)の処理という課題を効果的に解決し、単一LLMが犯す誤りを是正していることが示された。
- フレームワークは、StockSen や SEntFiN といった新しいデータセットを含む多様なデータセットで有効であるため、汎用性とゼロショットの転送可能性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。