[论文解读] Aligning AI With Shared Human Values
论文提出 ETHICS 数据集,以在多个规范伦理理论下评估语言模型对基本人类伦理的知识,评估若干大型 NLP 模型,并分析它们在开放世界情景中预测道德判断的能力。结果显示表现低而有希望,仍有明显改进空间,并对偏见与分歧有洞察。
We show how to assess a language model's knowledge of basic concepts of morality. We introduce the ETHICS dataset, a new benchmark that spans concepts in justice, well-being, duties, virtues, and commonsense morality. Models predict widespread moral judgments about diverse text scenarios. This requires connecting physical and social world knowledge to value judgements, a capability that may enable us to steer chatbot outputs or eventually regularize open-ended reinforcement learning agents. With the ETHICS dataset, we find that current language models have a promising but incomplete ability to predict basic human ethical judgements. Our work shows that progress can be made on machine ethics today, and it provides a steppingstone toward AI that is aligned with human values.
研究动机与目标
- 在规范伦理理论范围内,引入基准来衡量机器对基本道德概念的理解。
- 捕捉需要世界知识和价值联系的开放世界情境化道德判断。
- 评估最先进的 NLP 模型并识别差距及可引导更安全、更加对齐的 AI 输出的潜力。
提出的方法
- 创建覆盖正义、义务论、德行、功利主义和常识道德的 ETHICS 场景数据集。
- 使用 MTurk 和反事实增强以确保高质量、无歧义的标签。
- 在微调或少样本设置下评估多种预训练模型(BERT-base/large、RoBERTa-large、ALBERT-xxlarge)和 GPT-3。
- 用与任务相符的评估指标衡量性能:大多数任务使用 0/1 损失,功利主义任务使用排序准确度。
- 分析模型效用函数并评估预测中的偏见与范围敏感性。
- 通过具有争议性的常识道德子集检查分歧检测。
实验结果
研究问题
- RQ1预训练语言模型是否能够在开放世界情景中预测基本的人类伦理判断?
- RQ2不同的规范伦理理论(正义、义务论、德行、功利主义、常识道德)如何映射到模型预测?
- RQ3在模型对伦理的判断中存在哪些局限性与偏见,是否能够检测到分歧?
主要发现
- 模型在 ETHICS 任务上表现出低但有希望的准确性,较大或事先训练更充分的模型平均表现更好。
- RoBERTa-large 和 ALBERT-xxlarge 的平均分数高于较小模型,但难度测试(Hard Test)上的结果显著下降。
- GPT-3 少样本在对抗性筛选数据上与某些微调模型竞争力较强,但在普通数据上仍落后于较小的微调变换器。
- 学习到的效用函数和框架效应存在偏见,可能影响道德判断与类似电车难题的情景。
- 专门的有争议性常识道德示例数据集表明模型在区分有争议与非有争议的案例方面存在困难。
- 有证据表明模型性能随规模和数据增加而提升,但在困难/对抗性测试集中仍低于实际可用的上限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。