Skip to main content
QUICK REVIEW

[논문 리뷰] ToxCCIn: Toxic Content Classification with Interpretability

Tong Xiang, Sean MacAvaney|arXiv (Cornell University)|2021. 03. 01.
Hate Speech and Cyberbullying Detection참고 문헌 39인용 수 8
한 줄 요약

이 논문은 토xicity를 문장의 일부 구간들 중 가장 높은 독성 수준으로 모델링함으로써, 트랜스포머 기반 독성 탐지에서의 해석 가능성(해석 가능성)을 향상시키는 ToxCCIn을 제안한다. 전체 게시물의 독성은 모든 스파닝의 독성 점수 중 최댓값으로 결정된다. 다중 작업 학습 모델을 통해 전체 텍스트의 독성과 개별 스팬의 독성 점수를 동시에 예측함으로써, 높은 품질의 인간이 선호하는 설명을 생성하며, 기존의 로지스틱 회귀 모델에 비해 해석 가능성에서 뛰어나면서도 Civil Comments 데이터셋에서 높은 분류 성능 유지를 유지한다.

ABSTRACT

Despite the recent successes of transformer-based models in terms of effectiveness on a variety of tasks, their decisions often remain opaque to humans. Explanations are particularly important for tasks like offensive language or toxicity detection on social media because a manual appeal process is often in place to dispute automatically flagged content. In this work, we propose a technique to improve the interpretability of these models, based on a simple and powerful assumption: a post is at least as toxic as its most toxic span. We incorporate this assumption into transformer models by scoring a post based on the maximum toxicity of its spans and augmenting the training process to identify correct spans. We find this approach effective and can produce explanations that exceed the quality of those provided by Logistic Regression analysis (often regarded as a highly-interpretable model), according to a human study.

연구 동기 및 목표

  • 콘텐츠 모니터링에서 신뢰도와 수동 검토를 저해하는 최신 트랜스포머 모델의 독성 탐지에서의 해석 가능성 부족 문제를 해결하기 위해.
  • 특히 소셜 미디어 콘텐츠 모니터링과 같은 고위험 상황에서 모델 예측에 대한 인간이 이해할 수 있는 설명을 생성하는 방법을 개발하기 위해.
  • 새로운 다중 작업 학습 방식을 통해 도메인 내 및 도메인 간 설정 모두에서 모델 성능과 강건성을 향상시키기 위해.
  • 모델이 생성한 설명이 널리 사용되는 본질적으로 해석 가능한 모델인 로지스틱 회귀보다 해석 가능성에서 뛰어나다는가 평가하기 위해.

제안 방법

  • 게시물의 독성이 가장 독성이 강한 스팬의 독성보다 더 강하지 않다는 가정에 기반하여, 전체 독성은 모든 스팬의 독성 점수에서 최댓값을 취함으로써 결정된다.
  • 신경 기반 다중 작업 학습 프레임워크를 사용하여 (1) 전체 텍스트의 독성 분류와 (2) 토큰 단위 독성 점수 예측을 동시에 학습한다.
  • 기본 인코더로 BERT 또는 ELECTRA를 사용하며, 최종 레이어는 각 토큰의 독성 점수를 예측하고, 이를 최대 풀링을 통해 집계하여 최종 예측을 도출한다.
  • 학습 중에는 평균 제곱오차(MSE) 손실을 적용하여 극단적인 독성 점수(0 또는 1에 가까운 값)를 유도함으로써 예측의 극단화를 통해 해석 가능성 향상을 도모한다.
  • 독성어의 형태적 변형조차도 회피를 시도하더라도 유지할 수 있도록 WordPiece 토크나이제이션을 활용한다.
  • 예측된 독성 점수가 가장 높은 토큰들을 강조하여 설명을 생성함으로써 인간이 읽을 수 있는 모델 결정 근거를 제공한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 모델이 스팬의 최댓값으로 독성을 모델링함으로써 분류 성능을 희생시키지 않고도 더 높은 해석 가능성을 달성할 수 있는가?
  • RQ2제안된 방법이 생성한 설명이 인간 평가에서 로지스틱 회귀의 설명을 능가하는가?
  • RQ3표준 미세조정된 트랜스포머와 비교해 모델은 도메인 간 설정에서 어떻게 성능을 발휘하는가?
  • RQ4기존의 해석 가능한 모델과 비교해 모델의 설명은 어떤 정량적 강점과 약점이 있는가?

주요 결과

  • 인간 평가에서, 병합된 데이터셋에서 53.7%의 평가자가 BERT-MT(ToxCCIn)의 설명을 로지스틱 회귀의 설명보다 선호했으며, CCD 데이터셋에서는 59.4%가 선호했다.
  • Civil Comments Dataset( CCD)와 Offenseval 2019 Implicit Dataset( OLID) 양쪽 모두에서 BERT-MT는 해석 가능성에서 로지스틱 회귀를 능가했으며, 유의미한 선호도 격차를 보였다.
  • 모델은 도메인 내 및 도메인 간 평가 모두에서 기준 모델보다 높은 F1 점수를 기록하여 분류 효과성 향상을 입증했다.
  • BERT-MT는 맥락적으로 민감하거나 변형된 독성어를 포함한 경우에도 독성 스팬을 더 정확하게 식별하는 것으로 나타났으며, 이는 맥락 임베딩과 WordPiece 유지 기능 덕분이었다.
  • 다수의 비독성어가 함께 모여 독성을 암시하는 경우, 로지스틱 회귀가 더 포괄적인(다소 덜 정밀한) 설명을 생성하여 선호되었으며, 이는 설명의 포괄성에서 유리했다.
  • 모델은 부정된 모욕어나 악성으로 수정된 비하 표현과 같은 암묵적 독성 언어에서는 어려움을 겪었으며, 이는 양 모델 모두가 성능이 떨어지는 것으로 나타나 향후 암묵적 독성에 대한 연구가 필요하다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.