Skip to main content
QUICK REVIEW

[论文解读] Generative Agent Simulations of 1,000 People

Joon Sung Park, Changqing Zou|arXiv (Cornell University)|Nov 15, 2024
COVID-19 epidemiological studies被引用 31
一句话总结

本文基于自我报告数据(访谈和调查)构建生成代理,以模拟个体,在没有任务特定训练数据的情况下实现高准确性并降低跨群体偏差。

ABSTRACT

The promise of human behavioral simulation--general-purpose computational agents that replicate human behavior across domains--could enable broad applications in policymaking and social science. We present a novel agent architecture that simulates the attitudes and behaviors of 1,052 real individuals--applying large language models to qualitative interviews about their lives, then measuring how well these agents replicate the attitudes and behaviors of the individuals that they represent. The generative agents replicate participants' responses on the General Social Survey 85% as accurately as participants replicate their own answers two weeks later, and perform comparably in predicting personality traits and outcomes in experimental replications. Our architecture reduces accuracy biases across racial and ideological groups compared to agents given demographic descriptions. This work provides a foundation for new tools that can help investigate individual and collective behavior.

研究动机与目标

  • 证明基于自我报告数据的LLM代理能够在没有任务特定训练的情况下,对多样化的结果进行泛化。
  • 评估两种数据来源——半结构化访谈和结构化调查——对代理准确性的影响。
  • 评估结合两种来源是否改善性能并减少差异。
  • 展示代理在实验中对人格特质和行为的预测是否与人类相似。

提出的方法

  • 从两小时的半结构化访谈(American Voices Project)和/或结构化调查(General Social Survey,Big Five)构建代理。
  • 用自我报告数据对大语言模型进行锚定,以模拟个体,而不仅仅使用人口统计信息。
  • 在保留测试中的GSS条目上评估代理的准确性,并与两周的测试-再测试一致性进行对比。
  • 比较仅访谈、仅调查和组合数据在预测任务上的表现。
  • 相对于仅基于人口统计的基线,评估种族和意识形态群体在准确性方面的差异。

实验结果

研究问题

  • RQ1基于自我报告的LLM代理是否能够在没有任务特定训练数据的情况下,对多种结果进行泛化?
  • RQ2不同数据来源(访谈、调查,或两者)如何影响代理的准确性和一致性?
  • RQ3基于自我报告的代理是否在预测准确性方面减小种族和意识形态差异?
  • RQ4代理的预测与在人格特质和行为上的人类基线相比如何?
  • RQ5结合访谈和调查数据对仿真质量的影响是什么?

主要发现

  • 仅访谈的代理相对于参与者两周测试-再测试达到83%的准确性;仅调查的代理达到82%;组合数据的代理达到86%。
  • 仅以人口统计信息提示的基线代理达到74%准确性。
  • 代理在实验中对人格特质和行为的预测与人类具有相近的准确性。
  • 与仅基于人口统计的基线相比,基于自我报告的代理在不同种族和意识形态群体的准确性差异上有所减少。
  • 使用丰富的自我报告数据能够在不进行任务特定训练数据的情况下实现跨结果的通用仿真。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。