[论文解读] Are Language Models Worse than Humans at Following Prompts? It's Complicated
本文通过实证测试在先前语言模型(LMs)研究中使用的相同病态提示下人类的行为,挑战了语言模型(LMs)无法像人类一样遵循提示这一假设。研究发现,尽管人类会忽略无关提示(如语言模型一样),但他们会忠实地遵循误导性提示——这与假设中人类会拒绝此类指令的认知相反,揭示了人类与模型在欺骗情境下的行为关键差异。
Prompts have been the center of progress in advancing language models' zero-shot and few-shot performance. However, recent work finds that models can perform surprisingly well when given intentionally irrelevant or misleading prompts. Such results may be interpreted as evidence that model behavior is not "human like". In this study, we challenge a central assumption in such work: that humans would perform badly when given pathological instructions. We find that humans are able to reliably ignore irrelevant instructions and thus, like models, perform well on the underlying task despite an apparent lack of signal regarding the task they are being asked to do. However, when given deliberately misleading instructions, humans follow the instructions faithfully, whereas models do not. Our findings caution that future research should not idealize human behaviors as a monolith and should not train or evaluate models to mimic assumptions about these behaviors without first validating humans' behaviors empirically.
研究动机与目标
- 通过实证测试验证先前研究中假设的语言模型无法像人类一样遵循提示的行为是否成立。
- 调查人类是否如语言模型行为评估中所假设的那样,能可靠地忽略无关或误导性提示。
- 挑战将类人提示遵循行为作为评估语言模型有效基准的假设。
- 强调在将人类行为作为模型评估标准之前,必须进行实证验证。
提出的方法
- 改编Webson & Pavlick(2022)的实验设置,对人类在相同自然语言推理(NLI)和指代消解任务上使用指令性、误导性、无关性和空提示的表现进行测试。
- 对人类参与者开展零样本和少样本实验,包括对先前NLP经验的控制。
- 使用与先前语言模型研究中完全相同的提示类别(指令性、误导性、无关性、空提示),以确保直接比较。
- 收集自由文本回答,以理解参与者对提示的推理和理解方式。
- 分析不同提示类型下的表现,将人类准确率与同一刺激下模型的表现进行比较。
- 应用统计分析,评估人类表现是否在不同提示类别间存在显著差异。
实验结果
研究问题
- RQ1当给予误导性提示时,人类在NLI任务上的表现是否如先前语言模型评估所假设的那样变差?
- RQ2人类是否能像语言模型一样可靠地忽略无关提示?
- RQ3人类是否以与语言模型相同的方式解释并遵循误导性提示,还是反而会将其视为无意义而拒绝?
- RQ4对NLP任务的先前接触在多大程度上影响人类对病态提示的表现?
- RQ5人类对提示的理解在多大程度上与任务本意一致,而非仅受表面词汇线索的影响?
主要发现
- 人类在无关提示下的NLI任务表现几乎与指令性提示下的表现相当,表明其能够忽略无关内容。
- 当给予误导性提示时,人类在NLI任务上的表现显著变差——这与假设中人类会将其视为无意义而拒绝的认知相反。
- 当表面指令暗示不同任务(如语法正确性)时,人类会忠实地遵循误导性提示,即使实际任务是NLI。
- 误导性提示下的表现与参与者对表面任务的解读密切相关,而非与底层NLI逻辑相关。
- 即使没有先前NLP经验的参与者在误导性提示下表现依然不佳,表明问题并非源于领域专业知识。
- 自由文本回答显示,许多参与者将误导性提示理解为要求执行其他任务(如语法判断或改写),从而在实际NLI任务上给出错误答案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。