Skip to main content
QUICK REVIEW

[논문 리뷰] Can LLMs Replace Economic Choice Prediction Labs? The Case of Language-based Persuasion Games

Eilam Shapira, Omer Madmon|arXiv (Cornell University)|2024. 01. 30.
Stock Market Forecasting MethodsDecision Sciences인용 수 3
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 인간의 선택을 예측하는 데 사용되는 인공 데이터를 생성할 수 있음을 보여주며, 충분한 LLM 생성 데이터가 확보된 경우 실제 인간 데이터로 훈련된 모델보다 더 높은 정확도를 달성함을 보여준다. 이 방법은 다양한 성격을 가진 LLM 에이전트를 활용해 전략적 상호작용을 시뮬레이션하며, 인간 데이터 기반 기준 모델을 능가하고 핵심 설정에서는 인간 데이터 기반 모델을 초월함으로써 성능을 뛰어올린다.

ABSTRACT

Human choice prediction in economic contexts is crucial for applications in marketing, finance, public policy, and more. This task, however, is often constrained by the difficulties in acquiring human choice data. With most experimental economics studies focusing on simple choice settings, the AI community has explored whether LLMs can substitute for humans in these predictions and examined more complex experimental economics settings. However, a key question remains: can LLMs generate training data for human choice prediction? We explore this in language-based persuasion games, a complex economic setting involving natural language in strategic interactions. Our experiments show that models trained on LLM-generated data can effectively predict human behavior in these games and even outperform models trained on actual human data. Beyond data generation, we investigate the dual role of LLMs as both data generators and predictors, introducing a comprehensive empirical study on the effectiveness of utilizing LLMs for data generation, human choice prediction, or both. We then utilize our choice prediction framework to analyze how strategic factors shape decision-making, showing that interaction history (rather than linguistic sentiment alone) plays a key role in predicting human decision-making in repeated interactions. Particularly, when LLMs capture history-dependent decision patterns similarly to humans, their predictive success improves substantially. Finally, we demonstrate the robustness of our findings across alternative persuasion-game settings, highlighting the broader potential of using LLM-generated data to model human decision-making.

연구 동기 및 목표

  • LLM 생성 데이터가 경제적 환경에서 인간 의사결정을 예측하는 데 사용되는 인간 선택 데이터를 대체할 수 있는지 조사하기.
  • LLM 기반 에이전트를 언어 기반 설득 게임에서의 인공 참가자로 사용하는 것의 타당성과 효과성을 평가하기.
  • 실제 인간 데이터로만 훈련된 모델에 비해 LLM 생성 데이터로만 훈련된 모델이 인간 행동 예측에서 더 뛰어난 성능을 보일 수 있는지 판단하기.
  • 다양한 LLM 성격이 인공 훈련 데이터의 품질과 다양성에 미치는 영향을 분석하기.
  • LLM 기반 인공 데이터가 실제 인간 데이터보다 우월한 대안이 되는 조건을 탐색하기.

제안 방법

  • 연구는 Apel 등 (2022)이 제시한 언어 기반 설득 게임 프레임워크를 사용하며, 전문가(송신자)가 자연어 메시지를 통해 인간 의사결정자(결정자, DM)를 설득하여 호텔 할인 혜택을 수락하도록 유도한다.
  • LLM 기반 에이전트를 사용해 송신자 및 수신자 역할을 모두 시뮬레이션하며, 훈련 세트에 인간 선택 데이터가 전혀 포함되지 않은 채 인공 상호작용 데이터를 생성한다.
  • 중립, 지나치게 긍정적, 회의적인 등 다양한 성격 유형을 활용해 인공 데이터의 다양성을 높이고 모델의 일반화 능력을 향상시킨다.
  • 예측 모델은 LLM 생성 데이터만으로 훈련되어 송신자 메시지에 대한 인간 DM의 결정을 예측한다.
  • 각 성격 유형이 모델의 총 예측 성능에 기여하는 정도를 정량화하기 위해 셰플리 값(Shapley values)을 적용한다.
  • 예측 정확도를 실제 인간 데이터로 훈련된 모델 및 언어 기반 기준 모델과 비교함으로써 방법의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1LLM 생성 데이터로만 훈련된 모델이 실제 인간 데이터로 훈련된 모델과 동일하거나 더 정확하게 인간의 선택을 예측할 수 있는가?
  • RQ2인공 데이터 생성 시 LLM 성격의 다양성이 결과 모델의 예측 성능에 어떤 영향을 미치는가?
  • RQ3어떤 전문가 전략에서 LLM 생성 데이터 접근 방식이 인간 데이터에 비해 슈퍼리어하거나 열등한 성능을 보이는가?
  • RQ4각 성격 유형이 인공 데이터셋의 예측 품질에 기여하는 마진널 기여도는 얼마인가?
  • RQ5LLM 기반 인공 데이터는 경제적 선택 예측에서 비용이 많이 들고 개인정보가 민감한 인간 데이터 수집의 필요성을 줄일 수 있는가?

주요 결과

  • LLM 생성 데이터셋의 크기가 충분히 클 경우, 실질적으로 인간 선택 데이터로만 훈련된 모델보다 LLM 생성 데이터로만 훈련된 모델이 더 높은 성능을 보인다.
  • 단순 전략(예: SendBest)인 경우에도 LLM 기반 접근 방식이 뛰어난 예측 정확도를 달성한다. 이 경우 전문가는 호텔 품질에 관계없이 항상 최상의 리뷰를 전송한다.
  • 다양한 LLM 성격의 조합을 사용해 데이터를 생성할 경우, 기본(중립) 성격만 사용하는 것보다 더 작은 샘플 수로도 목표 정확도에 도달할 수 있다.
  • 셰플리 값 분석 결과, 모든 성격 유형이 인공 데이터셋의 예측 능력에 거의 균형 잡힌 기여를 하며, 이는 균형 잡힌 필수 기여를 의미한다.
  • LLM 기반 인공 데이터 접근 방식은 언어 기반 기준 모델보다 일관되게 뛰어난 성능을 보이며, 이는 맥락 인식 기반의 에이전트 행동이 인간 행동 모델링의 정확성에 필수적임을 시사한다.
  • 이 방법은 인간 참가자가 필요한 수를 크게 줄여 훈련 효율성과 확장성을 높인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.