[論文レビュー] Can LLMs Replace Economic Choice Prediction Labs? The Case of Language-based Persuasion Games
この論文は、大規模言語モデル(LLM)が、人間の選択を予測する言語ベースの説得ゲームの訓練に使用する合成データを生成できることを示しており、十分な量のLLM生成データが利用可能な場合、実際の人間データで訓練されたモデルよりも高い精度を達成している。このアプローチでは、多様なキャラクターを持つLLMエージェントを用いて戦略的対話をシミュレートし、人間データベースラインを上回り、特定の状況では人間データモデルをも凌駆する。
Human choice prediction in economic contexts is crucial for applications in marketing, finance, public policy, and more. This task, however, is often constrained by the difficulties in acquiring human choice data. With most experimental economics studies focusing on simple choice settings, the AI community has explored whether LLMs can substitute for humans in these predictions and examined more complex experimental economics settings. However, a key question remains: can LLMs generate training data for human choice prediction? We explore this in language-based persuasion games, a complex economic setting involving natural language in strategic interactions. Our experiments show that models trained on LLM-generated data can effectively predict human behavior in these games and even outperform models trained on actual human data. Beyond data generation, we investigate the dual role of LLMs as both data generators and predictors, introducing a comprehensive empirical study on the effectiveness of utilizing LLMs for data generation, human choice prediction, or both. We then utilize our choice prediction framework to analyze how strategic factors shape decision-making, showing that interaction history (rather than linguistic sentiment alone) plays a key role in predicting human decision-making in repeated interactions. Particularly, when LLMs capture history-dependent decision patterns similarly to humans, their predictive success improves substantially. Finally, we demonstrate the robustness of our findings across alternative persuasion-game settings, highlighting the broader potential of using LLM-generated data to model human decision-making.
研究の動機と目的
- LLM生成データが、経済的状況における人間の意思決定を予測するモデルの訓練に、人間の選択データを代替できるかどうかを調査すること。
- LLMベースのエージェントを言語ベースの説得ゲームにおける合成参加者として使用する可能性と有効性を評価すること。
- LLM生成データにのみ訓練されたモデルが、実際の人間データで訓練されたモデルを上回る性能を示すかどうかを特定すること。
- 多様なLLMキャラクターが、合成トレーニングデータの質と多様性に与える影響を分析すること。
- LLMベースの合成データが、人間の選択予測において、コストが高くプライバシーに配慮が必要な人間データ収集の必要性を低減する条件を探索すること。
提案手法
- 研究は、Apelら(2022)が提唱した言語ベースの説得ゲームフレームワークを用い、送信者(専門家)が自然言語メッセージを用いて人間意思決定者(DM)を説得し、ホテルの契約を受け入れさせる。
- LLMベースのエージェントを用いて送信者および受信者という両方の役割をシミュレートし、トレーニングセットに人間の選択データを一切含めない合成対話データを生成する。
- 中立的、過剰に肯定的、懐疑的などの多様なキャラクター(例:中立的、過剰に肯定的、懐疑的)を用いて、合成データの多様性を高め、モデルの一般化性能を向上させる。
- 予測モデルをLLM生成データにのみ訓練し、送信者のメッセージに対する人間DMの意思決定を予測する。
- 各キャラクターの種類がモデル全体の予測性能に与える限界寄与度を測定するために、シャープレー値を適用する。
- 予測精度を、実際の人間データで訓練されたモデルや言語的ベースラインと比較することで、アプローチの有効性を評価する。
実験結果
リサーチクエスチョン
- RQ1LLM生成データにのみ訓練されたモデルが、実際の人間データで訓練されたモデルと同等、あるいはそれ以上の精度で、言語ベースの説得ゲームにおける人間の選択を予測できるか?
- RQ2合成データ生成におけるLLMキャラクターの多様性が、得られるモデルの予測性能に与える影響は何か?
- RQ3どの専門家戦略において、LLM生成データアプローチが人間データを上回り、あるいは下回るか?
- RQ4各キャラクター種別が、合成データセットの予測品質に果たす限界寄与度は何か?
- RQ5LLMベースの合成データは、経済的選択予測における、高コストかつプライバシーに配慮が必要な人間データ収集の必要性を低減できるか?
主な発見
- LLM生成データセットが十分に大きい場合、LLM生成データにのみ訓練されたモデルが、実際の人間選択データで訓練されたモデルを上回る性能を示す。
- 単純な専門家戦略(SendBest)の場合、つまり専門家がホテルの質に関係なく常に最良のレビューを送信する場合でさえ、LLMベースのアプローチが優れた予測精度を達成する。
- 多様なLLMキャラクターの組み合わせをデータ生成に用いることで、デフォルト(中立的)キャラクターのみを使用する場合と比較して、特定の精度水準に到達するためのサンプルサイズを削減できる。
- シャープレー値分析から、すべてのキャラクター種別が合成データセットの予測力にほぼ均等に寄与していることが判明し、バランスの取れた重要性が示された。
- LLMベースの合成データアプローチは、言語的ベースラインを常に上回り、文脈に即したエージェント行動が、人間行動モデリングの正確さにとって不可欠であることを示している。
- この手法により、人間参加者の数を著しく削減でき、トレーニングの効率性とスケーラビリティが向上する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。