Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models as Simulated Economic Agents: What Can We Learn from Homo Silicus?

John J. Horton, Filippas, Apostolos|arXiv (Cornell University)|2023. 01. 18.
Economic Policies and Impacts인용 수 47
한 줄 요약

본 논문은 GPT-3와 유사한 LLM이 인간의 암묵적 계산 모델(homo silicus)로 기능할 수 있으며 시뮬레이션을 통해 고전적 행동경제학 결과를 질적으로 재현할 수 있어, 현실 세계의 실험에 앞서 저비용의 확장 가능한 파일럿 연구를 가능하게 한다고 주장한다.

ABSTRACT

We argue that newly-developed large language models (LLMs), because of how they are trained and designed, are implicit computational models of humans -- a Homo silicus. LLMs can be used like economists use Homo economicus: they can be given endowments, information, preferences, and so on, and then their behavior can be explored in scenarios via simulation. Experiments using this approach, derived from Charness and Rabin (2002), Kahneman et al. (1986), Samuelson and Zeckhauser (1988), Oprea (2024b), and Horton (2025), show qualitatively similar results to the original, and when they differ, it is often generative for future research. We discuss potential applications, conceptual issues, and why this approach can inform the study of humans.

연구 동기 및 목표

  • LLMs를 인간의 경제적 행동의 암묵적 모델(homo silicus)로 제안하고 검증한다.
  • GPT-3가 행동경제학 실험의 질적 발견을 재현할 수 있음을 보여준다(예: 독재자 게임, 가격 남용, 현상 유지 편향).
  • LLMs에 신념, 선호, 프레이밍을 부여하는 것이 경제적 시나리오에서의 선택에 어떻게 영향을 미치는지 보여준다.
  • 실제 세계 테스트 전에 매개변수 공간을 저비용으로 탐색하기 위한 인실리코 파일럿의 잠재력을 강조한다.

제안 방법

  • GPT-3 모델에 다양한 사회적 선호(공정성, 효율성, 이익추구)를 부여하고 시나리오 전반에 걸친 독재자 게임 선택을 관찰한다.
  • 프레이밍과 정치적 유사 신념을 조작하여 Kahneman 스타일의 시나리오에서 가격 남용 판단에 미치는 효과를 연구한다.
  • 현상 유지 편향을 재현하기 위해 자금 배분이 현상 유지로 제시되는 방식과 중립적으로 제시되는 방식을 다르게 한다.
  • 최저임금 하에서 임금과 경력 간 교환관계를 검토하기 위한 고용 시나리오를 실행하고 관찰된 선택과 결과를 분석한다.
  • GPT-3 변형(text-davinci-003, text-ada-001, text-babbage-001, text-currie-001) 및 온도 설정 간 출력을 비교하여 강건성을 평가한다.
  • LLM 응답의 추론적 특성과 잠재적 수행성 문제를 고려하여 관찰의 해석에 대해 논의한다.
Figure 1 : Charness and Rabin ( 2002 ) Simple Tests choices by model type and endowed “personality”
Figure 1 : Charness and Rabin ( 2002 ) Simple Tests choices by model type and endowed “personality”

실험 결과

연구 질문

  • RQ1GPT-3 스타일의 LLM이 고전 행동경제학 실험의 질적 패턴을 재현할 수 있는가?
  • RQ2LLM에 부여된 선호, 프레이밍, 정치적 유사 관점이 경제적 선택에 어떤 영향을 주는가?
  • RQ3비용과 속도 측면에서 사회과학 실험의 파일럿에 대한 LLM 기반 시뮬레이션의 가치는 어느 정도인가?
  • RQ4모델의 능력이 이러한 과업에서 homo economicus에 근접한 행동이나 인간다운 의사결정을 제한하거나 가능하게 하는 정도는 어느 정도인가?
  • RQ5모델 변형과 프롬프트 형식에 걸쳐 AI 생성 결과의 강건성은 얼마나 되는가?

주요 결과

  • LLMs는 독재자 게임 설정에서 불평등, 효율성, 이익추구에 기반한 선택을 모방할 수 있으며, 고급 모델은 부여된 선호에 민감하게 반응한다.
  • 가격 남용 및 프레이밍 과제에서 AI 에이전트의 공정성 판단은 가격 수준과 정치적 프레이밍에 따라 달라지며 인간의 패턴을 닮고 일부 설정에서 프레이밍 효과를 보인다.
  • 현상 유지 프레이밍 편향은 옵션이 현상 유지로 제시될 때 AI 응답에서 나타나 인간의 현상 유지 편향을 반영한다.
  • 최저임금 시나리오는 AI 시뮬레이션에서 임금 상승과 경험이 더 많은 채용으로의 이동을 유도하여 시뮬레이션된 수준에서의 노동-노동 대체 효과를 시사한다.
  • 경험적으로 GPT-3 모델은 상당한 고전적 행동 결과를 질적으로 재현하며 비용이 거의 들지 않아 신속하고 대규모의 탐색적 연구를 가능하게 한다.
  • 이 연구는 LLM을 실험실 도구로 활용하여 빠르고 인실리코 실험을 통해 실제 세계의 실증 연구를 안내하는 것을 주장한다.
Figure 2 : Kahneman et al. ( 1986 ) price gouging snow shovel question, with endowed political views
Figure 2 : Kahneman et al. ( 1986 ) price gouging snow shovel question, with endowed political views

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.