[논문 리뷰] The Emergence of Economic Rationality of GPT
이 연구는 복수의 도메인—위험, 시간, 사회적 선호, 식품—에 걸쳐 GPT의 예산 배분 결정을 평가함으로써 GPT의 경제적 이성성을 조사한다. 이론적 기반은 드러난 선호 이론이다. GPT는 유사한 실험에서 인간 참가자들보다 높은 이성성 점수를 보이며, 인구통계학적 및 무작위성 변동에 대해 강건하지만, 프레임 및 선택 형식에 민감하다.
As large language models (LLMs) like GPT become increasingly prevalent, it is essential that we assess their capabilities beyond language processing. This paper examines the economic rationality of GPT by instructing it to make budgetary decisions in four domains: risk, time, social, and food preferences. We measure economic rationality by assessing the consistency of GPT's decisions with utility maximization in classic revealed preference theory. We find that GPT's decisions are largely rational in each domain and demonstrate higher rationality score than those of human subjects in a parallel experiment and in the literature. Moreover, the estimated preference parameters of GPT are slightly different from human subjects and exhibit a lower degree of heterogeneity. We also find that the rationality scores are robust to the degree of randomness and demographic settings such as age and gender, but are sensitive to contexts based on the language frames of the choice situations. These results suggest the potential of LLMs to make good decisions and the need to further understand their capabilities, limitations, and underlying mechanisms.
연구 동기 및 목표
- GPT가 다양한 도메인에서 의사결정 시 경제적 이성성을 보이는지 평가하는 것.
- 드러난 선호 이론을 사용하여 GPT의 이성성과 인간 참가자들의 이성성을 비교하는 것.
- 무작위성, 인구통계학적 프레임, 선택 맥락의 변동에 대해 GPT의 이성성이 얼마나 강건한지 조사하는 것.
- LLM과 인간 간의 선호 매개변수 이질성과 그 배경 메커니즘을 탐구하는 것.
- LLM의 의사결정 품질이 향후 경제적 및 사회적 맥락에서의 AI 응용에 미치는 영향을 평가하는 것.
제안 방법
- GPT는 각 도메인당 25건의 예산 배분 결정을 내리도록 프롬프트되었으며, 가격이 다른 두 재화 간에 100점을 분배하는 방식이었다.
- 이성성은 예산 제약 하에 효용 극대화를 위한 필수적이고 충분한 조건인 일반화된 드러난 선호의 원리(GARP)를 통해 측정되었다.
- 네 가지의 별도된 의사결정 환경을 구성하였다: 위험 자산, 시간 간의 선택, 사회적 이전, 식품 선호.
- 이성성 점수는 아프리아트 효율성 지수(CCEI)와 로그 가격 대 로그 수요 비율 간 피어슨 상관계수를 사용하여 계산되었다.
- 실험에는 가격 프레임(예: 비용 대 수익), 선택 형식(연속형 대 이산형), 인구통계학적 프레임(연령, 성별, 인종)의 변형이 포함되었다.
- 347명의 미국 참가자로 이루어진 병렬 인간 참가자 실험을 통해 GPT와 인간 간의 이성성 점수를 직접 비교할 수 있었다.
실험 결과
연구 질문
- RQ1GPT는 위험, 시간, 사회적 선호, 식품 선호 분야의 예산 배분 과제에서 얼마나 경제적 이성성을 보여주는가?
- RQ2동일한 실험 설정에서 GPT의 이성성 점수는 인간 참가자들과 비교해 어떻게 되는가?
- RQ3GPT의 이성성은 무작위성, 인구통계학적 프레임, 선택 맥락의 변동에 대해 강건한가?
- RQ4GPT의 추정된 선호 매개변수는 인간과 비교해 이질성과 일관성 측면에서 어떻게 다른가?
- RQ5언어적 프레임과 선택 형식은 GPT의 이성성 점수에 어떤 영향을 미치는가?
주요 결과
- GPT는 현재 실험과 더 넓은 문헌 전반에서 인간 참가자들보다 유의미하게 높은 이성성 점수를 기록하였다.
- GPT의 이성성은 연령, 성별, 인종, 교육 수준 등의 인구통계학적 설정과 응답의 무작위성 수준에 대해 강건하였다.
- 선택 과제가 다른 언어적 프레임(예: 비용 대 수익 프레임)으로 제시되거나 이산형 선택 형식으로 제시될 경우, 이성성 점수는 크게 감소하였다.
- GPT의 추정된 선호 매개변수는 인간 참가자들보다 이질성이 적어 더 일관된 의사결정 패턴을 보였다.
- GPT의 선택에서 로그 가격 대 로그 수요 비율 간 상관계수가 인간 참가자들보다 더 강했으며, 이는 효용 극대화와의 더 나은 일치를 시사한다.
- 위험, 시간, 사회, 식품의 네 도메인 전반에서 GPT의 결정은 GARP와 일관되게 유지되었으며, 이는 높은 수준의 드러난 선호 일관성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.