Skip to main content
QUICK REVIEW

[论文解读] Moral Mimicry: Large Language Models Produce Moral Rationalizations Tailored to Political Identity

Gabriel Simmons|arXiv (Cornell University)|Sep 24, 2022
Computational and Text Analysis Methods被引用 11
一句话总结

本研究调查了大型语言模型(LLMs)是否表现出‘道德模仿’——即通过道德基础理论,根据自由派或保守派政治身份提示生成与之相符的道德辩护。结果表明,LLMs 确实会再现与政治立场一致的道德偏见,且模型越大,模仿能力越强,表明其在生成内容中可能加剧意识形态极化风险。

ABSTRACT

Large Language Models (LLMs) have demonstrated impressive capabilities in generating fluent text, as well as tendencies to reproduce undesirable social biases. This study investigates whether LLMs reproduce the moral biases associated with political groups in the United States, an instance of a broader capability herein termed moral mimicry. This hypothesis is explored in the GPT-3/3.5 and OPT families of Transformer-based LLMs. Using tools from Moral Foundations Theory, it is shown that these LLMs are indeed moral mimics. When prompted with a liberal or conservative political identity, the models generate text reflecting corresponding moral biases. This study also explores the relationship between moral mimicry and model size, and similarity between human and LLM moral word use.

研究动机与目标

  • 调查大型语言模型(LLMs)是否再现与政治身份相关的道德偏见,这一现象被称为‘道德模仿’。
  • 考察模型规模对 LLM 中道德模仿程度的影响。
  • 比较 LLM 生成的道德基础使用情况与人类共识及个体人类道德语言使用的相似性。
  • 评估 LLM 是否能根据情境和身份提示生成语境恰当的道德辩护。

提出的方法

  • 使用标准化模板,将情境、政治身份短语和道德立场组合成提示。
  • 基于道德基础理论(MFT)分析生成文本,重点关注五项基础:关怀/伤害、公平/欺骗、忠诚/背叛、权威/颠覆、圣洁/堕落。
  • 应用 MFT 词典量化 LLM 完成文本中的道德基础使用情况。
  • 比较以‘自由派’与‘保守派’身份提示生成的模型输出,衡量道德基础使用差异。
  • 评估模型规模(如 GPT-3、GPT-3.5、OPT)与道德模仿强度之间的关系。
  • 使用效应量和统计比较,测量人类与 LLM 道德用词使用的相似性。

实验结果

研究问题

  • RQ1LLMs 是否生成反映自由派或保守派政治身份相关道德基础的道德辩护?
  • RQ2模型规模如何影响 LLM 中道德模仿的程度?
  • RQ3LLM 生成文本中的道德基础使用与人类共识及个体人类使用有多相似?
  • RQ4LLMs 是否会根据情境性道德场景调整其道德基础使用?

主要发现

  • LLMs 生成的文本在道德基础使用上与提示中提供的政治身份(自由派或保守派)相一致,表现出道德模仿现象。
  • 道德模仿的程度随模型规模增加而增强,尤其在 OPT 系列及 GPT-3/3.5 模型中表现明显。
  • 相较于小型模型,大型模型与政治身份相关的道德基础偏见更一致。
  • LLMs 会根据情境语境调整其道德基础使用,提升与情境的相关性,但尚未达到与人类共识无差别的程度。
  • LLM 生成的道德语言与人类共识的道德基础使用差异,大于个体人类之间的差异,表明其模仿存在不完美性。
  • 道德模仿现象在多个 LLM 系列(GPT-3/3.5 和 OPT)中均被观察到,表明这是当前先进模型中一种可泛化的特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。