[论文解读] Prompt Design Matters for Computational Social Science Tasks but in Unpredictable Ways
本研究探讨了提示设计如何影响大型语言模型(LLM)在计算社会科学任务中的合规性与准确性,测试了四种提示特征——定义包含、输出类型、解释请求和提示长度——在三种LLM(ChatGPT、PaLM2、Falcon7b)上执行四项任务(毒性、情感、谣言立场、新闻框架)时的表现。结果表明,提示设计对合规性与准确性的影响力极大,且影响方式不可预测,具有任务和模型特异性,数值评分会降低性能,而解释请求会改变标签分布。
Manually annotating data for computational social science tasks can be costly, time-consuming, and emotionally draining. While recent work suggests that LLMs can perform such annotation tasks in zero-shot settings, little is known about how prompt design impacts LLMs' compliance and accuracy. We conduct a large-scale multi-prompt experiment to test how model selection (ChatGPT, PaLM2, and Falcon7b) and prompt design features (definition inclusion, output type, explanation, and prompt length) impact the compliance and accuracy of LLM-generated annotations on four CSS tasks (toxicity, sentiment, rumor stance, and news frames). Our results show that LLM compliance and accuracy are highly prompt-dependent. For instance, prompting for numerical scores instead of labels reduces all LLMs' compliance and accuracy. The overall best prompting setup is task-dependent, and minor prompt changes can cause large changes in the distribution of generated labels. By showing that prompt design significantly impacts the quality and distribution of LLM-generated annotations, this work serves as both a warning and practical guide for researchers and practitioners.
研究动机与目标
- 探究提示设计特征如何影响大型语言模型在计算社会科学标注任务中的合规性与准确性。
- 解决在多样化LLM与任务中缺乏系统性、大规模实证证据的问题,以评估提示的有效性。
- 考察简洁提示、包含定义的提示或请求解释的提示是否能提升或降低性能。
- 揭示由于细微提示变化导致的标注分布不一致所带来的风险,这可能使社会科学研究产生偏差。
- 为研究人员在零样本标注任务中使用LLM提供基于证据的最佳实践建议。
提出的方法
- 在四个提示维度(定义包含、输出类型(标签 vs. 分数)、解释请求、提示长度(标准 vs. 简洁))上,开展大规模、完整因子设计实验,共16种提示变体(2×2×2×2)。
- 将这些提示应用于三种LLM(ChatGPT、PaLM2、Falcon7b)在四项计算社会科学任务上:毒性、情感、谣言立场和新闻框架检测。
- 使用涵盖所有任务-模型-提示组合的联合数据集,共362,928条LLM生成的标注结果。
- 测量合规性(对提示指令的遵循程度)和准确性(与人工标注黄金标准的一致性)。
- 分析提示间标签分布的变化,特别是当包含解释或数值评分时。
- 报告合规性方差(例如,Falcon7b在谣言立场任务上最高达55%)和准确性方差(例如,ChatGPT在新闻框架任务上最高达14%)的定量结果。
实验结果
研究问题
- RQ1在不同计算社会科学任务中,提示中包含定义如何影响LLM的合规性与准确性?
- RQ2与类别标签相比,请求数值评分对LLM的合规性与准确性有何影响?
- RQ3在不同模型与任务中,简洁提示与标准长度提示在合规性与准确性方面有何差异?
- RQ4请求推理解释在多大程度上改变了标签分布与合规率?
- RQ5提示设计特征的影响如何在不同LLM(如ChatGPT、PaLM2、Falcon7b)与任务之间变化?
主要发现
- 与请求类别标签相比,请求数值评分在所有LLM和大多数任务中显著降低了合规性与准确性。
- 包含定义提升了ChatGPT的准确性,且未降低其合规性,但降低了PaLM2与Falcon7b的合规性。
- 简洁提示在Falcon7b的谣言立场任务中提升了成本效率,且未损害合规性或准确性,但在其他大多数情况下损害了性能。
- 请求解释提高了合规性,但改变了标签分布——例如,当要求提供解释时,ChatGPT将34%的更多内容标记为“中立”。
- 表现最佳的提示配置高度依赖于任务与模型,微小变化即可导致输出分布的大幅波动。
- Falcon7b在谣言立场任务中,不同提示的合规性差异最高达55%;ChatGPT在新闻框架任务中,准确性差异最高达14%,凸显了提示效应的不可预测性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。