[論文レビュー] Are LLMs Rational Investors? A Study on Detecting and Reducing the Financial Bias in LLMs
本稿では、行動ファイナンス理論を用いてリスク志向性や認知バイアスを評価するため、大規模言語モデル(LLMs)における金融的非合理行動を評価・低減するための Financial Bias Indicators (FBI) フレームワークを提案する。大規模な金融系LLMですら、損失回避やフレーミング効果などの顕著なリスク志向性バイアスを示すことが判明し、一般向けモデルよりも深刻な場合がある。これは、特化型のファインチューニングと構造化されたプロンプト設計の必要性を示唆している。
Large Language Models (LLMs) are increasingly adopted in financial analysis for interpreting complex market data and trends. However, their use is challenged by intrinsic biases (e.g., risk-preference bias) and a superficial understanding of market intricacies, necessitating a thorough assessment of their financial insight. To address these issues, we introduce Financial Bias Indicators (FBI), a framework with components like Bias Unveiler, Bias Detective, Bias Tracker, and Bias Antidote to identify, detect, analyze, and eliminate irrational biases in LLMs. By combining behavioral finance principles with bias examination, we evaluate 23 leading LLMs and propose a de-biasing method based on financial causal knowledge. Results show varying degrees of financial irrationality among models, influenced by their design and training. Models trained specifically on financial datasets may exhibit more irrationality, and even larger financial language models (FinLLMs) can show more bias than smaller, general models. We utilize four prompt-based methods incorporating causal debiasing, effectively reducing financial biases in these models. This work enhances the understanding of LLMs' bias in financial applications, laying the foundation for developing more reliable and rational financial analysis tools.
研究の動機と目的
- LLMsの投資意思決定文脈における金融的合理性を評価すること。
- 行動ファイナンスの原則を用いて、損失回避、フレーミング効果、アンカーリングなどの非合理的バイアスを同定・定量すること。
- モデルアーキテクチャ、トレーニングデータ、入力フォーマットが金融意思決定バイアスに与える影響を調査すること。
- LLMsにおける金融的非合理行動を検出・測定するための体系的フレームワーク(FBI)を開発すること。
- 特化型ファインチューニングと入力設計を通じて、より合理的で信頼性の高い金融LLMsの設計を支援すること。
提案手法
- 行動ファイナンス理論に基づき、Belief(信念)とリスク志向性の2つの次元に沿って金融的合理性を構造化する Financial Bias Indicators (FBI) フレームワークを提案する。
- アンカーリング、フレーミング、損失回避といった行動ファイナンスの現象に基づいた制御された実験を設計し、モデルの反応を調査する。
- 言語的フレーミングと入力フォーマットへの感受性をテストするため、直接入力、指示型入力、翻訳済みプロンプトの3種類の入力タイプを用いる。
- 複数のシナリオにおいて、モデルの反応をリスク回避的、リスク中立的、リスク求心的の3カテゴリに分類することで、リスク志向性を定量的に測定する。
- 行動ファイナンス理論に根ざした標準化された金融意思決定タスクを用いることで、一貫性と理論的根拠を確保する。
- 19のLLMsにわたるモデル出力を統計的比較と一貫性チェックを用いて分析し、バイアスパターンを検出する。

実験結果
リサーチクエスチョン
- RQ1LLMsは、投資意思決定の文脈において、損失回避やフレーミング効果といった行動ファイナンスのバイアスをどの程度示しているか?
- RQ2入力フォーマット(直接入力、指示型、翻訳済み)の選択が、LLMsのリスク志向性分類にどのように影響するか?
- RQ3金融特化型LLMs(FinLLMs)は一般向けLLMsよりも高い金融的合理性を示すのか、それともより顕著なバイアスを示すのか?
- RQ4モデルのスケーリングとトレーニングデータの構成が、金融推論における認知バイアスへの感受性に与える影響は何か?
- RQ5構造化されたプロンプト設計とファインチューニングは、観察された金融的非合理行動を低減できるか?
主な発見
- GPT-4は直接入力シナリオで最も高いリスク回避率(89.5%)を示し、強い損失回避バイアスを示している。
- Qwen-72Bは入力フレーミングへの感受性が最も高く、直接入力と翻訳済みプロンプトの間でリスク志向性に56.0%の差を示した。
- ChatGLM3-TurboとGLM-4は、それぞれ74.0%および69.0%の損失回避バイアスを示し、リスク認識における強い感情的重み付けがうかがえる。
- FinQwenでさえ、損失回避タスクで57.5%のリスク回避を示しており、分野特化型のトレーニングがバイアスを完全に排除しないことを示している。
- GPT-4 や Qwen-72B といった大規模モデルであっても、一貫した合理性を示すとは限らず、GPT-4 は指示型モードで181件のリスク回避反応を示し、極めて不一致を示した。
- プロンプトの翻訳により、リスク志向性分類に顕著なシフトが生じた。例えば、Baichuan2-7B は直接入力時と翻訳済み入力時で両方とも67%のリスク回避を示したが、同時に58%がリスク中立的であり、言語的フレーミングへの高い感受性が示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。