[论文解读] Large Language Models Can Be Used to Estimate the Latent Positions of Politicians
本文提出 LaMP,一种使用指令微调的大语言模型进行成对比较以估计隐含政治家在意识形态、枪支管制和堕胎问题上的立场,并通过Bradley-Terry模型进行缩放,并将这些量表与现有测量和预测选举数据进行验证。
Existing approaches to estimating politicians' latent positions along specific dimensions often fail when relevant data is limited. We leverage the embedded knowledge in generative large language models (LLMs) to address this challenge and measure lawmakers' positions along specific political or policy dimensions. We prompt an instruction/dialogue-tuned LLM to pairwise compare lawmakers and then scale the resulting graph using the Bradley-Terry model. We estimate novel measures of U.S. senators' positions on liberal-conservative ideology, gun control, and abortion. Our liberal-conservative scale, used to validate LLM-driven scaling, strongly correlates with existing measures and offsets interpretive gaps, suggesting LLMs synthesize relevant data from internet and digitized media rather than memorizing existing measures. Our gun control and abortion measures -- the first of their kind -- differ from the liberal-conservative scale in face-valid ways and predict interest group ratings and legislator votes better than ideology alone. Our findings suggest LLMs hold promise for solving complex social science measurement problems.
研究动机与目标
- 为在数据稀缺或不完整时衡量隐性立法者立场提出新方法。
- 利用指令微调的大语言模型中嵌入的知识,对参议员进行成对比较。
- 使用 Bradley-Terry 模型将 LLM 的响应转换为连续的潜在位置分数(LaMP 分数)。
- 将所得的 LaMP 分数与既有意识形态测量和外部结果进行验证。
- 展示基于 LLM 的缩放在特定议题政治维度上的潜在应用。
提出的方法
- 在第116届国会中为每个目标维度创建所有参议员之间的成对对比。
- 提示经过指令/对话微调的 LLM(ChatGPT-3.5)在每场对比中为给定维度(自由/保守意识形态、枪支管制、堕胎权)选择一个“胜者”。
- 应用 Bradley-Terry 模型将成对胜者/败者转化为单一维度潜在尺度(LaMP 分数)。
- 在每场对比中仅以姓名、党派和州作为输入,进行零-shot 设置,不提供示例。
- 通过在三次迭代中重复对比并计算迭代间相关性来评估稳定性。
- 将 Ideology LaMP 与 DW-NOMINATE 和感知意识形态/CFscores 进行对比验证,然后将 Gun Control LaMP 和 Abortion Rights LaMP 与 NRA/NARAL 结果及相关投票进行验证。
实验结果
研究问题
- RQ1生成型 LLM 是否能够对事先定义的政治维度就立法者做出一致的成对判断?
- RQ2LLM 来源的量表是否与 DW-NOMINATE 等既有意识形态测量和感知意识形态分数保持一致?
- RQ3面向特定议题的 LaMP 量表(枪支管制、堕胎权)是否对外部结果(NRA 评分、NARAL 评分及相关投票)具备预测效度?
- RQ4LaMP 分数是否能捕捉超越传统基于行为或感知的意识形态度量的信息?
主要发现
- Ideology LaMP 分数与 DW-NOMINATE 的第一维高度相关(总体相关性为 0.967)。
- Ideology LaMP 分数与感知意识形态(0.941)和 CFscores(0.933)相关。
- Gun Control LaMP 分数能预测 NRA 评分和 2022 年两党制更安全社区法案的投票,显示出超越 DW-NOMINATE 的预测效度(例如仅用 Gun Control LaMP 预测共和党人在 NRA 投票时的相关系数为 0.214)。
- Abortion Rights LaMP 分数与已知的支持堕胎权/反堕胎立场一致,并比 DW-NOMINATE 更好地预测 NARAL 评分。
- LaMP 分数在不同迭代之间保持稳定(Ideology LaMP 相关性 ≥0.997;Gun Control LaMP 相关性 ≥0.993;Abortion Rights LaMP 相关性 ≥0.996)。
- LaMP 量表揭示了与纯党派意识形态不同的差异,能够捕捉如因意识形态原因的保守投票或面向议题的立场等细微差别(例如 Manchin 对 Collin 的堕胎问题立场对比)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。