[论文解读] Despite "super-human" performance, current LLMs are unsuited for decisions about ethics and safety
这篇论文表明,尽管大型语言模型(LLMs)在ETHICS-C-S等伦理推理基准上达到了'超人类'的准确率,但它们在伦理和安全关键决策方面本质上并不适用。通过一种新颖的提示策略——相似性提示(SimPrompting),作者实现了94.5%的准确率,超过人类表现,但揭示出LLMs依赖于表面的词汇模式而非真正的道德推理,因此容易受到对抗性改写、反向缩放效应以及荒谬的解释影响,即使在被要求解释其推理过程时也是如此。
Large language models (LLMs) have exploded in popularity in the past few years and have achieved undeniably impressive results on benchmarks as varied as question answering and text summarization. We provide a simple new prompting strategy that leads to yet another supposedly "super-human" result, this time outperforming humans at common sense ethical reasoning (as measured by accuracy on a subset of the ETHICS dataset). Unfortunately, we find that relying on average performance to judge capabilities can be highly misleading. LLM errors differ systematically from human errors in ways that make it easy to craft adversarial examples, or even perturb existing examples to flip the output label. We also observe signs of inverse scaling with model size on some examples, and show that prompting models to "explain their reasoning" often leads to alarming justifications of unethical actions. Our results highlight how human-like performance does not necessarily imply human-like understanding or reasoning.
研究动机与目标
- 调查在伦理推理基准上表现优异的LLMs是否真正反映了类人的理解能力。
- 评估LLMs对输入情景对抗性改写(adversarial rewording)的鲁棒性。
- 检查模型缩放和思维链(chain-of-thought)提示是否改善或加剧了伦理推理的失败。
- 揭示人类与LLM在伦理判断中的系统性差异。
- 证明高准确率并不意味着在伦理情境中具备可靠或安全的决策能力。
提出的方法
- 提出相似性提示(SimPrompting),一种基于输入情景与上下文示例之间词汇重叠度来选择示例的方法。
- 使用GPT-3(2019年最大版本及当前版本)在ETHICS-C-S数据集上生成预测,并比较不同模型的性能表现。
- 对正确分类的示例进行对抗性改写,使其变为错误预测,同时保持人类可理解性。
- 评估模型的置信度分数,并分析在要求'解释其推理'时的推理链。
- 通过Mechanical Turk收集人类判断,以对比人类与模型的错误模式。
- 分析错误类型与解释内容,识别LLM中的系统性失败,如虚构事实和不道德的合理化解释。
实验结果
研究问题
- RQ1LLMs能否在不具有真正道德理解的前提下,于伦理推理基准上实现'超人类'表现?
- RQ2对输入情景进行对抗性改写如何影响LLM的预测结果?这些改写是否仍保持人类可理解性?
- RQ3增加模型规模是否会提升或降低伦理推理的可靠性,特别是在边缘案例中?
- RQ4思维链提示在多大程度上增强或扭曲了LLM的伦理推理能力?
- RQ5LLM在伦理判断任务中犯的错误类型是否系统性地不同于人类?
主要发现
- 通过SimPrompting,GPT-3在ETHICS-C-S上实现了94.5%的准确率,超过人类表现(93.7% ± 0.6%)。
- 对模型正确分类的情景进行改写后,预测标签常被翻转,而人类对改写后版本的判断与原版一致。
- 在某些示例上,模型表现出反向缩放现象:随着模型规模增大,对错误答案的置信度反而提高。
- 思维链提示常生成听起来合理但事实错误或伦理上不可接受的解释,用于明显错误的答案。
- 人类错误主要源于假设差异(44.2%)或简单错误(10.9%和7.2%),而LLM错误则源于词汇模式匹配而非概念性推理。
- 即使在涉及极端伤害的情景中(如'我用我精彩的布道把教堂点着了'),模型仍会生成虚构事实和无根据的合理化解释。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。