Skip to main content
QUICK REVIEW

[논문 리뷰] Explainable Patterns for Distinction and Prediction of Moral Judgement on Reddit

Ion Stagkos Efstathiadis, Guilherme Paulino-Passos|arXiv (Cornell University)|2022. 01. 26.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 논문은 r/AmITheAsshole에서 유래한 600만 건의 Reddit 댓글 데이터셋을 소개하고, 게시물(62% 정확도)과 댓글(86% 정확도)에서 도덕적 판단을 예측하기 위한 BERT 기반 분류기를 제안한다. GrASP를 통해 언어와 도덕적 입장을 연결하고 모델 결정을 해석 가능한 텍스트 패턴으로 식별함으로써, 소셜 미디어에서의 AI 기반 도덕적 판단 예측의 해석 가능성과 신뢰도를 향상시킨다.

ABSTRACT

The forum r/AmITheAsshole in Reddit hosts discussion on moral issues based on concrete narratives presented by users. Existing analysis of the forum focuses on its comments, and does not make the underlying data publicly available. In this paper we build a new dataset of comments and also investigate the classification of the posts in the forum. Further, we identify textual patterns associated with the provocation of moral judgement by posts, with the expression of moral stance in comments, and with the decisions of trained classifiers of posts and comments.

연구 동기 및 목표

  • 소셜 미디어에서 도덕적 판단을 예측하는 데 도전하는 것, 특히 Reddit의 비정형적이고 주관적이며 장문의 서술적 내역에서의 도덕적 판단 예측에 초점한다.
  • 재현 가능한 연구를 지원하기 위해 r/AmITheAsshole에서 유래한 600만 건의 레이블이 부여된 Reddit 댓글 데이터셋을 공개적으로 제공하는 것.
  • GrASP를 사용하여 도덕적 입장을 표현하는 언어 패턴과 모델 예측에 관련된 패턴을 식별함으로써 도덕적 판단 분류기의 해석 가능성을 향상시키는 것.
  • 장기적 맥락, 클래스 불균형, 주관적인 레이블링으로 인해 BERT의 분류 성능에 제한이 있음을 분석하고, 이를 개선하기 위한 방안을 모색하는 것.

제안 방법

  • 게시물과 댓글을 '악플' (YTA/ESH)와 '아님' (NTA/NAH)로 이진 분류하기 위해 BERT-base-cased 모델을 미세조정한다.
  • Pushshift API를 통해 r/AmITheAsshole의 600만 건의 주요 댓글을 크롤링하고, 품질 기준과 판정 태그를 기준으로 필터링하며, 유출 방지를 위해 태그를 제거하여 데이터셋을 구축한다.
  • GrASP(GloBal Rule-based Pattern Search)를 적용하여 실제 레이블과 BERT 예측 레이블 간의 관련성을 가진 고정보 수익성 텍스트 패턴을 추출한다.
  • 정보 수익을 사용하여 패턴을 순위 매기며, 도덕적 입장을 표현하는 언어적 신호와 분류기 결정에 관련된 패턴을 식별할 수 있도록 한다.
  • 초기화 매개변수 튜닝을 수행하고, 불균형한 테스트 세트에서 정확도, 정밀도, 재현율, F1 점수를 사용하여 성능을 평가한다.
  • 기본 모델(예: 다항 나이브 베이즈, 로지스틱 회귀)과의 성능 비교를 통해 클래스 불균형과 모델 편향으로 인한 차이를 분석한다.

실험 결과

연구 질문

  • RQ1BERT는 Reddit 게시물의 도덕적 판단을 분류하는 데 어떤 성능을 보이며, 무엇이 정확도를 저하시키는 주요 도전 과제인가?
  • RQ2댓글과 게시물에서 텍스트 패턴은 실제 도덕적 입장과 BERT 예측 레이블 간에 어떻게 관련되어 있으며, 사회학적 통찰을 제공하는가?
  • RQ3GrASP를 통해 추출한 설명 가능한 패턴은 도덕적 판단 분류기의 투명성과 신뢰도를 어느 정도 향상시키는가?
  • RQ4왜 분류기가 게시물에서 댓글보다 성능이著しく 열 劣하나, 이 격차를 초래하는 요인은 무엇인가?
  • RQ5BERT 예측 레이블에서 유도된 패턴은 실제 레이블에 드러나지 않는 모델의 편향이나 일관성 없는 행동을 드러내는가?

주요 결과

  • BERT 분류기는 Reddit 게시물의 도덕적 판단 예측에서 62%의 정확도를 기록했으며, 다수 클래스 기반 베이스라인을 뛰어넘지 못했다. 이는 장문의 텍스트, 주관성, 클래스 불균형으로 인해 작업이 어렵다는 점을 시사한다.
  • 댓글에 대해서는 BERT 분류기가 86%의 정확도를 기록했으며, 다수 클래스 기반 베이스라인을 초월하여 댓글 수준의 도덕적 판단은 게시물 수준보다 더 예측 가능하다는 것을 보여준다.
  • GrASP는 특정 언어 패턴이 도덕적 입장을 어떻게 반영하는지 식별하는 고정보 수익성 패턴을 발견했다. 예를 들어 'I just' 또는 'I didn’t realize'는 'sweetheart' (NTA/NAH) 판정과 관련이 있다.
  • BERT 예측 레이블에서 유도된 패턴은 실제 레이블에서 유도된 패턴보다 유의미하게 높은 정보 수익을 보였으며, 이는 모델 결정이 인간 레이블링 데이터보다 더 일관성이 있다는 것을 시사한다.
  • 단어 'edit'는 실제로 'asshole'과 더 자주 연관되지만, BERT는 이를 'sweetheart'로 잘못 분류하는 경향을 보였으며, 이는 중립어의 맥락 이해에 대한 BERT의 한계를 드러낸다.
  • GrASP 패턴의 수동 보정 과정에서 일부 'sweetheart'와 연관된 것으로 간주된 패턴이 실제로는 'asshole'를 시사하는 것으로 밝혀져, 설명 가능성 도구의 검증에 인간의 참여가 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.