[论文解读] Large Language Models: An Applied Econometric Framework
本文提出了一套计量经济学框架,用于评估大型语言模型(LLMs)在经济学研究中可信赖使用的时机。该框架区分了预测与估计任务,表明只有在不存在训练数据泄露的情况下,LLMs 才适用于预测;只有在 LLM 输出与金标准测量结果同样准确时,LLMs 才适用于估计;否则,即使准确度很高,偏差仍会持续存在。
Large language models (LLMs) enable researchers to analyze text at unprecedented scale and minimal cost. Researchers can now revisit old questions and tackle novel ones with rich data. We provide an econometric framework for realizing this potential in two empirical uses. For prediction problems -- forecasting outcomes from text -- valid conclusions require ``no training leakage'' between the LLM's training data and the researcher's sample, which can be enforced through careful model choice and research design. For estimation problems -- automating the measurement of economic concepts for downstream analysis -- valid downstream inference requires combining LLM outputs with a small validation sample to deliver consistent and precise estimates. Absent a validation sample, researchers cannot assess possible errors in LLM outputs, and consequently seemingly innocuous choices (which model, which prompt) can produce dramatically different parameter estimates. When used appropriately, LLMs are powerful tools that can expand the frontier of empirical economics.
研究动机与目标
- 建立 LLM 输出在经济学研究中可被可靠使用且不引入偏差的严格条件。
- 解决 LLM 缺乏类似 OLS 等传统方法的正式计量经济学契约的问题。
- 识别 LLM 在预测与估计中可适用的时机,以及实现有效推断所需的前提假设。
- 为研究人员提供避免基于 LLM 的实证研究中常见陷阱的实用指导。
- 强调 LLM 无法在实验环境中完全替代人工数据收集,尤其是在测量人类行为时。
提出的方法
- 将 LLM 视为黑箱,忽略其内部架构和训练数据。
- 区分两类实证任务:预测(例如,从文本中预测结果)与估计(例如,从文本或人类回答中测量经济概念)。
- 对于预测任务,要求 LLM 的训练语料库与研究者样本之间不存在训练数据泄露,以确保有效性。
- 对于估计任务,要求 LLM 输出与所替代的金标准测量结果同样准确,以避免偏差。
- 提出收集验证数据以建模 LLM 测量误差,并在估计任务中校正偏差。
- 倡导使用训练数据有文档记录且权重已公开的开源 LLM,以防止数据泄露。
实验结果
研究问题
- RQ1在何种条件下,LLM 输出可在经济学研究中可靠地用于预测?
- RQ2在何种情况下,使用 LLM 估计从文本或人类回答中得出的经济概念是合理的?
- RQ3训练数据泄露如何影响基于 LLM 的预测与估计的有效性?
- RQ4LLM 输出中的测量误差在多大程度上会扭曲计量经济学估计结果?
- RQ5在哪些研究情境中,LLM 可以有意义地模拟人类受试者响应,而无需完全替代真实数据收集?
主要发现
- LLM 用于预测只有在 LLM 的训练数据与研究者样本之间无数据泄露时才有效。
- 对于估计任务,LLM 输出必须与金标准测量结果一样准确,才能避免偏差,即使其准确度很高。
- 训练数据泄露是一个重大风险,尤其是在公开发布的实验或调查被纳入 LLM 训练语料库时。
- LLM 在经济推理任务中的响应可能对提示工程高度敏感,表明其性能具有脆弱性。
- 必须收集验证数据以建模并校正估计任务中 LLM 的测量误差。
- 在实验研究中,LLM 只能放大而非完全替代人类受试者数据,尤其是在实验设计数量庞大时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。