[論文レビュー] Deficiency of Large Language Models in Finance: An Empirical Examination of Hallucination
本稿は、金融分野における大規模言語モデル(LLMs)の幻覚現象を実証的に調査し、金融用語の説明や歴史的株価の照会に関する正確性を評価している。オフザシェルのLLMsは深刻な幻覚を示すが、プロンプトベースのツール学習とRAGにより事実の正確性が著しく向上し、ツール拡張型モデルでは株価照会で100%の正確性を達成した。
The hallucination issue is recognized as a fundamental deficiency of large language models (LLMs), especially when applied to fields such as finance, education, and law. Despite the growing concerns, there has been a lack of empirical investigation. In this paper, we provide an empirical examination of LLMs' hallucination behaviors in financial tasks. First, we empirically investigate LLM model's ability of explaining financial concepts and terminologies. Second, we assess LLM models' capacity of querying historical stock prices. Third, to alleviate the hallucination issue, we evaluate the efficacy of four practical methods, including few-shot learning, Decoding by Contrasting Layers (DoLa), the Retrieval Augmentation Generation (RAG) method and the prompt-based tool learning method for a function to generate a query command. Finally, our major finding is that off-the-shelf LLMs experience serious hallucination behaviors in financial tasks. Therefore, there is an urgent need to call for research efforts in mitigating LLMs' hallucination.
研究の動機と目的
- 金融タスクに適用された際のLLMsにおける幻覚現象を、特に金融用語の説明や歴史的株価の照会に関して、実証的に検証すること。
- 時間的依存性があり、事実に厳密な要求がかかる金融クエリを処理する際、オフザシェルのLLMsの信頼性を評価すること。
- 少数例プロンプティング、DoLaデコード、RAG、プロンプトベースのツール学習の4つの緩和戦略の有効性を評価すること。
- 外部の事実確認メカニズムがなければ、幻覚現象がLLMsを実世界の金融応用に導入する際の重要な障壁であることを示すこと。
- 高リスクな金融AIシステムにおける事実の信頼性を確保するため、幻覚緩和に関する的を絞った研究を提唱すること。
提案手法
- ゼロショットおよび少々ショットプロンプティングを用いて、LLMsが金融的概念や用語を説明する能力を実証的に評価した。
- 実世界のクエリを用いた、歴史的株価を正確に取得できるかをテストするベンチマークタスクを設計した。
- 少々ショットプロンプティング、対照的層によるデコード(DoLa)、リtrieval-Augmented Generation(RAG)、関数呼び出し生成のためのプロンプトベースのツール学習の4つの緩和技術を評価した。
- プロンプトベースのツール学習を実装し、最新の金融データにアクセスするための正しいAPIクエリを生成できるようにLLMsを拡張した。
- ゼロショットおよび少々ショット設定を用いて、Llama2-7B、Llama2-13B、GPT-3.5-turbo、GPT-4を含む複数のLLMsの性能を比較した。
- モデル出力と正解の完全一致評価を通じて、事実の正確性を測定した。
実験結果
リサーチクエスチョン
- RQ1オフザシェルのLLMsは、金融用語や用語を説明する際、どの程度幻覚を示すのか?
- RQ2外部ツールやリtrievalメカニズムなしで、LLMsは歴史的株価をどの程度正確に取得できるのか?
- RQ3少々ショットプロンプティング、DoLaデコード、RAG、プロンプトベースのツール学習は、金融分野のLLMタスクにおける幻覚をどの程度軽減できるのか?
- RQ4プロンプトベースのツール学習は金融クエリタスクでほぼ完璧な正確性を達成できるのか?他の手法と比較してどうなるか?
- RQ5DoLaと少々ショットプロンプティングは、金融データ関連の知識ギャップに対処する上で、どのような限界を有するのか?
主な発見
- オフザシェルのLLMsは、金融タスクにおいて深刻な幻覚を示し、金融用語の説明や株価の取得において顕著な事実誤認を示した。
- Llama2-7BおよびLlama2-7B-chatモデルは、外部ツールなしでゼロショットの株価照会においてほぼゼロの正確性を示し、事実中心のタスクにおいて信頼性が低いことが明らかになった。
- プロンプトベースのツール学習により、Llama2-7BおよびLlama2-7B-chatは1ショットの例のみを用いても株価照会で100.00%の正確性を達成した。これはその高い有効性を示している。
- GPT-3.5-turboおよびGPT-4はゼロショットモードでは株価照会に答えられなかったが、プロンプトベースのツール学習で拡張することで完璧な正確性を達成した。
- 少々ショットプロンプティングは、質問への回答フォーマットの遵守を改善したが、事実の正確性に顕著な向上は見られず、幻覚の軽減に限界があることが示唆された。
- DoLaデコードは、事実の正確性にやや向上を示したが、特に特定の株価ティッカー情報が事前学習データに十分に含まれていない場合、その改善効果は限定的であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。