Skip to main content
QUICK REVIEW

[논문 리뷰] Building Interpretable Models for Moral Decision-Making

Mayank Goel, Aritra Das|arXiv (Cornell University)|2026. 02. 03.
Psychology of Moral and Emotional Judgment인용 수 0
한 줄 요약

저자는 구조화된 트롤리 문제 시나리오에 맞춘 Compact 2-layer 트랜스포머를 설계하여 Moral Machine 데이터에서 77%의 검증 정확도를 달성하고, 작은 모델 내에서 도덕적 추론의 기계적 해석을 상세하게 가능하게 한다.

ABSTRACT

We build a custom transformer model to study how neural networks make moral decisions on trolley-style dilemmas. The model processes structured scenarios using embeddings that encode who is affected, how many people, and which outcome they belong to. Our 2-layer architecture achieves 77% accuracy on Moral Machine data while remaining small enough for detailed analysis. We use different interpretability techniques to uncover how moral reasoning distributes across the network, demonstrating that biases localize to distinct computational stages among other findings.

연구 동기 및 목표

  • 구조화된 트롤리 문제 시나리오에서 작고 목적에 특화된 모델이 일반 도덕 원리를 학습할 수 있음을 입증한다.
  • 해석 가능성 기법이 도덕적 편향을 트랜스포머의 서로 다른 계산 단계에 국한시킬 수 있음을 보여준다.
  • 캐릭터 유형, 수, 팀 구성 등이 도덕 판단에 어떤 영향을 미치는지 메커니즘적 분석을 제공한다.
  • 누가 영향을 받는지, 얼마나 많은 이들이 영향을 받는지, 어느 편에 속하는지 등을 인코딩하는 아키텍처를 제안하고 검증한다.

제안 방법

  • 64-dim 임베딩과 2개의 어텐션 헤드를 갖는 2-layer 트랜스포머를 설계한다.
  • 문자당 합성 임베딩 사용: [문자 임베딩; 수적임베딩; 팀 임베딩].
  • 입력에 [CLS] 토큰을 앞에 추가하고 46 토큰 입력(각 결과당 23개)에 표준 트랜스포머 인코더를 적용한다.
  • CLS 표현에 대해 2층 MLP 헤드를 학습시켜 결과 선호에 대한 스칼라 로짓을 출력한다.
  • 전향 순서와 역방향 순서의 평균을 사용한 대칭화로 추론 시 편의 없이 측면 불변성을 확보한다.
  • 정확도와 해석 가능성의 균형을 선택하기 위해 여러 아키텍처 변형을 평가한다.
  • DoWhy를 활용한 인과 개입으로 문자 유형의 평균 처리 효과를 추정한다.
  • 레이어별 귀속을 수행하여 편향을 특정 레이어와 헤드에 매핑한다.
  • 회로 프로빙을 사용하여 최종 점수를 가능하게 하는 희소 서브네트워크를 식별한다.
  • 토큰 전체에 걸친 그래디언트 가중 어텐션으로 지역적 중요도를 계산하고 대칭성을 위한 재매핑 점수의 평균을 구한다.
Figure 1: Overview of the paper
Figure 1: Overview of the paper

실험 결과

연구 질문

  • RQ1구조화된 트롤리 문제 데이터에서 일반 도덕 원리를 학습할 수 있는 작고 컴팩트한 트랜스포머가 가능한가?
  • RQ2얕은 트랜스포머의 어느 레이어/헤드에서 도덕적 편향이 국소화되는가?
  • RQ3인과 개입, 레이어별 속성화, 회로 프로빙이 도덕 판단의 내부 기제를 어느 정도 밝혀낼 수 있는가?
  • RQ4모델의 아키텍처가 누가 영향을 받는지, 얼마나 많은 이들이 영향을 받는지, 팀 배치를 의사결정으로 어떻게 인코딩하는가?

주요 결과

  • 최종 모델(d=64, H=2, L=2)은 held-out Moral Machine 시나리오에서 77.1%의 검증 정확도를 달성한다.
  • 인과 개입은 문자들 간에 명확한 도덕 계층을 보여주며, 임신한 인물(Pregnant)과 유아동(Stroller)이 긍정적 영향을 주고 범죄자(Criminal)가 부정적 영향을 준다.
  • 레이어별 편향 위치화는 합법성 편향이 주로 레이어 0에서, 종(species) 편향은 주로 레이어 1에서 나타나 기능적 특화가 계층 간에 존재함을 시사한다.
  • 회로 프로빙은 Layer 1 MLP에서 최종 점수에 인과적으로 기여하는 희소 서브네트워크(256개 뉴런 중 45개)를 식별했고, 정확도에서 0.012의 감소를 유발하는 제거 효과를 보인다.
  • 국소적 관련성 분석은 Crimial(0.27 상대 관련성)과 맥락/역할 기반 토큰 등 핵심 토큰에 상당한 의사결정 영향을 부여하고, 인구통계 토큰의 기여는 덜한 편으로 나타난다.
Figure 2: Causal influence of character types on model decisions, estimated via DoWhy backdoor adjustment controlling for group sizes. Blue bars indicate positive causal effects (model favors outcomes containing these characters); red bars indicate negative effects.
Figure 2: Causal influence of character types on model decisions, estimated via DoWhy backdoor adjustment controlling for group sizes. Blue bars indicate positive causal effects (model favors outcomes containing these characters); red bars indicate negative effects.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.