Skip to main content
QUICK REVIEW

[论文解读] Building Interpretable Models for Moral Decision-Making

Mayank Goel, Aritra Das|arXiv (Cornell University)|Feb 3, 2026
Psychology of Moral and Emotional Judgment被引用 0
一句话总结

作者设计了一个针对结构化托马斯测试情景的紧凑两层变换器,在 Moral Machine 数据上实现 77% 的验证准确率,并使小模型的道德推理具备详细的机械性可解释性分析能力。

ABSTRACT

We build a custom transformer model to study how neural networks make moral decisions on trolley-style dilemmas. The model processes structured scenarios using embeddings that encode who is affected, how many people, and which outcome they belong to. Our 2-layer architecture achieves 77% accuracy on Moral Machine data while remaining small enough for detailed analysis. We use different interpretability techniques to uncover how moral reasoning distributes across the network, demonstrating that biases localize to distinct computational stages among other findings.

研究动机与目标

  • 证明一个小型、专门设计的模型能够从结构化的托马斯测试情景中学习到普遍的道德原则。
  • 表明可解释性技术能够将道德偏见局部化到变换器的不同计算阶段。
  • 提供对角色类型、数量与队伍归属如何影响道德判断的机械性分析。
  • 提出并验证一种编码谁受到影响、影响人数以及他们所属侧的体系结构。

提出的方法

  • 设计一个具有 64 维嵌入和 2 个注意头的两层变换器。
  • 对每个角色使用组合嵌入: [角色嵌入; 基数嵌入; 队伍嵌入]。
  • 在输入前缀一个 [CLS] 标记,并将标准变换器编码器应用于 46-token 输入(每个结果 23 个)。
  • 在 CLS 表征上训练一个两层 MLP 头,以输出结果偏好 的标量逻辑值。
  • 通过推理时的对称化(使用前向和反向顺序的平均值)实现侧向不变性。
  • 评估不同体系结构变体以在准确性与可解释性之间取得平衡。
  • 应用因果干预(DoWhy)以估计角色类型的平均处理效应。
  • 进行逐层归因以将偏差映射到特定层和头。
  • 使用电路探测来识别能够产生最终道德分数的稀疏子网络。
  • 利用梯度加权注意力对令牌的局部相关性进行计算,并对对称性重新映射的分数进行平均。
Figure 1: Overview of the paper
Figure 1: Overview of the paper

实验结果

研究问题

  • RQ1紧凑的变换器是否能从结构化的托马斯测试数据中学习出一般道德原则?
  • RQ2道德偏见在浅层变换器的哪些层/头中局部化?
  • RQ3因果干预、逐层归因和电路探测在揭示道德判断的内部机制方面的作用程度如何?
  • RQ4模型结构如何编码谁受到影响、影响人数以及队伍分配以驱动决策?

主要发现

  • 最终模型在 d=64、H=2、L=2 的配置下,在未见 Moral Machine 场景上的验证准确率达到 77.1%。
  • 因果干预显示角色之间存在清晰的道德层级,其中孕妇和婴儿车对结果有积极影响,罪犯则带来负面影响。
  • 逐层偏置定位显示在第 0 层主要存在 legality 偏置,而在第 1 层主要出现物种偏置,显示层之间的功能专门化。
  • 电路探测指出第 1 层 MLP 中存在一个稀疏子网络(256 个神经元中的 45 个)对最终分数具有因果贡献,消融后准确率下降 0.012。
  • 局部相关性分析表明对关键标记如 Criminal(相对相关性 0.27)以及上下文/角色相关标记的决策影响显著,而人口统计学标记贡献较小。
Figure 2: Causal influence of character types on model decisions, estimated via DoWhy backdoor adjustment controlling for group sizes. Blue bars indicate positive causal effects (model favors outcomes containing these characters); red bars indicate negative effects.
Figure 2: Causal influence of character types on model decisions, estimated via DoWhy backdoor adjustment controlling for group sizes. Blue bars indicate positive causal effects (model favors outcomes containing these characters); red bars indicate negative effects.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。