Skip to main content
QUICK REVIEW

[論文レビュー] Building Interpretable Models for Moral Decision-Making

Mayank Goel, Aritra Das|arXiv (Cornell University)|Feb 3, 2026
Psychology of Moral and Emotional Judgment被引用数 0
ひとこと要約

著者らは構造化されたトロリーモラル状況に特化したコンパクトな2層トランスフォーマーを設計し、Moral Machineデータで検証精度77%を達成するとともに、小規模モデル内での道徳的推論の機械的解釈可能性分析を詳細に可能にした。

ABSTRACT

We build a custom transformer model to study how neural networks make moral decisions on trolley-style dilemmas. The model processes structured scenarios using embeddings that encode who is affected, how many people, and which outcome they belong to. Our 2-layer architecture achieves 77% accuracy on Moral Machine data while remaining small enough for detailed analysis. We use different interpretability techniques to uncover how moral reasoning distributes across the network, demonstrating that biases localize to distinct computational stages among other findings.

研究の動機と目的

  • 小さく目的設計されたモデルが構造化されたトロリーモラル状況から一般的な道徳原則を学習できることを示す。
  • 解釈可能性技術がトランスフォーマー内の異なる計算段階に道徳的偏りを局在化できることを示す。
  • キャラクタータイプ・数・チーム所属が道徳判断にどのように影響するかの機械的分析を提供する。
  • 誰が影響を受けるか、どれくらい影響を受けるか、どちらの側に属するかを符号化するアーキテクチャを提案し検証する。

提案手法

  • 64次元埋め込みと2つのアテンションヘッドを持つ2層トランスフォーマーを設計する。
  • キャラクターごとに:[キャラクター埋め込み; 基数埋め込み; チーム埋め込み]を用いた構成埋め込み。
  • [CLS]トークンを前方に付加し、46トークン入力(結果あたり23)に標準的なトランスフォーマーエンコーダを適用する。
  • CLS表現上で2層MLPヘッドを訓練し、アウトカム選好のスカラーロジットを出力する。
  • 推論時の前方・後方順序の平均を用いた対称化により側の不変性を課す。
  • 精度と解釈可能性のバランスを選択するためにアーキテクチャのバリエーションを評価する。
  • 因果介入(DoWhy)を適用してキャラクタータイプの平均処置効果を推定する。
  • 層別の寄与度推定を行い、偏りを特定の層とヘッドにマッピングする。
  • サーキット探査を用いて最終スコアを可能にする稀なサブネットワークを特定する。
  • トークン全体の勾配重み付きアテンションで局所的な関連性を計算し、対称性のために再マッピングされたスコアを平均する。
Figure 1: Overview of the paper
Figure 1: Overview of the paper

実験結果

リサーチクエスチョン

  • RQ1構造化されたトロリーモデータから、コンパクトなトランスフォーマーが一般的な道徳原理を学習できるか?
  • RQ2浅いトランスフォーマー内で道徳的偏りはどの層/ヘッドに局在するか?
  • RQ3因果介入・層別寄与・サーキット探査は道徳判断の内部機構をどの程度明らかにできるか?
  • RQ4モデルのアーキテクチャは、誰が影響を受けるか、どれくらいか、チーム割り当てを意思決定にどのように符号化しているか?

主な発見

  • 最終モデルは d=64、H=2、L=2で-held-out Moral Machineのシナリオに対して77.1%の検証精度を達成。
  • 因果介入はキャラクター間に明確な道徳的階層を示し、PregnantおよびStrollerがポジティブな影響を、Criminalがネガティブな影響を与えることを示した。
  • 層別寄与度の局在化は法的偏向が主にLayer 0に、種族偏向が主にLayer 1に現れ、層間機能的特化を示唆。
  • サーキット探査によりLayer 1のMLPにおけるスパースなサブネットワーク(256ニューロン中45個)が最終スコアに因果的に寄与し、アブレーションで精度が0.012低下。
  • 局所的関連性分析は、Criminalなどの主要トークン(相対的関連性0.27)や文脈/役割ベースのトークンに大きな意思決定影響を帰属させ、人口統計トークンの寄与は小さい。
Figure 2: Causal influence of character types on model decisions, estimated via DoWhy backdoor adjustment controlling for group sizes. Blue bars indicate positive causal effects (model favors outcomes containing these characters); red bars indicate negative effects.
Figure 2: Causal influence of character types on model decisions, estimated via DoWhy backdoor adjustment controlling for group sizes. Blue bars indicate positive causal effects (model favors outcomes containing these characters); red bars indicate negative effects.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。