[논문 리뷰] Empirical Analysis of Multi-Task Learning for Reducing Model Bias in Toxic Comment Detection
이 논문은 폭력적 댓글과 정체성 언급을 동시에 예측함으로써 소수자 정체성(예: 게이, 블랙, 무슬림)에 대한 잘못된 경고를 줄이기 위해 주의 기반 다중 작업 학습 모델을 제안한다. 작업 간 표현을 공유하고 맞춤형 가중 손실을 사용함으로써 모델은 의도하지 않은 편향을 줄이며, 기준 모델(예: 구글의 Perspective API 포함)에 비해 비폭력적 정체성 언급 댓글의 평균 폭력성 점수를 10% 낮춘다.
With the recent rise of toxicity in online conversations on social media platforms, using modern machine learning algorithms for toxic comment detection has become a central focus of many online applications. Researchers and companies have developed a variety of models to identify toxicity in online conversations, reviews, or comments with mixed successes. However, many existing approaches have learned to incorrectly associate non-toxic comments that have certain trigger-words (e.g. gay, lesbian, black, muslim) as a potential source of toxicity. In this paper, we evaluate several state-of-the-art models with the specific focus of reducing model bias towards these commonly-attacked identity groups. We propose a multi-task learning model with an attention layer that jointly learns to predict the toxicity of a comment as well as the identities present in the comments in order to reduce this bias. We then compare our model to an array of shallow and deep-learning models using metrics designed especially to test for unintended model bias within these identity groups.
연구 동기 및 목표
- 폭력적 댓글 탐지에서 소수자 정체성(예: 게이, 블랙, 무슬림)을 언급하는 비폭력적 댓글이 과도하게 폭력적이라고 분류되는 의도하지 않은 모델 편향을 해결한다.
- 폭력성과 정체성 탐지의 공동 학습이 이러한 정체성 집단에 대한 잘못된 경고 비율을 줄일 수 있는지 조사한다.
- 암묵적 편향을 탐지할 수 있도록 설계된 메트릭을 사용하여 최신의 얕은 및 깊은 학습 모델과 비교해 제안된 모델의 성능을 평가한다.
- 주목적 기반 학습과 가중 손실 함수를 통해 공정성을 향상시키면서도 폭력성 탐지 성능을 희생시키지 않는다는 것을 입증한다.
- 현재 모델(예: Perspective API 포함)이 명시적으로 학습되지 않았음에도 불구하고 특정 정체성 집단에 대해 측정 가능한 편향을 보임을 경험적으로 입증한다.
제안 방법
- 동일한 입력에서 댓글의 폭력성과 특정 정체성 어휘(예: 게이, 무슬림)의 존재를 동시에 예측하는 다중 작업 학습 프레임워크를 설계한다.
- 장거리 의존성과 단어 간 맥락적 관계를 포착하기 위해 주의 메커니즘을 통합하여 폭력적 및 비폭력적 댓글 간의 구분 능력을 향상시킨다.
- 비폭력적 정체성 언급 댓글에서 잘못된 양성 예측에 대한 처벌을 강화하는 맞춤형 가중 손실 함수를 사용하여 이러한 오류를 최소화하도록 모델을 유도한다.
- Jigsaw 폭력성 분류에서의 의도하지 않은 편향 챌린지에서 유래한 1,804,874개의 댓글로 구성된 대규모 데이터셋을 사용해 모델을 훈련한다.
- 폭력성 및 정체성 예측 헤드 간 공유 표현을 활용하는 전이 학습 원칙을 적용하여 모델을 미세조정한다.
- 정체성별 평가 메트릭을 사용해 모델 성능을 비교하며, 비폭력적 및 폭력적 댓글 템플릿에서의 평균 폭력성 점수를 포함한다.
실험 결과
연구 질문
- RQ1폭력성과 정체성 탐지의 공동 학습이 소수자 정체성을 언급하는 비폭력적 댓글의 잘못된 경고 비율을 줄일 수 있는가?
- RQ2주목적 기반 학습 모델에 주의 기반 기능과 함께 맞춤형 가중 손실 함수를 적용한 제안된 모델이 기준 모델(예: CNN, LSTM, 로지스틱 회귀)에 비해 공정성과 편향 완화 측면에서 어떻게 성과를 내는가?
- RQ3Google의 Perspective API는 명시적으로 학습되지 않았음에도 불구하고 특정 정체성 집단에 대해 의도하지 않은 편향을 보이는가?
- RQ4맞춤형 가중 손실 함수가 전체 폭력성 탐지 성능을 떨어뜨리지 않으면서도 비폭력적 정체성 언급 댓글에서 잘못된 양성 예측을 효과적으로 줄일 수 있는가?
- RQ5특히 과거에 높은 잘못된 양성 비율을 보였던 정체성 집단에 대해 제안된 모델의 성능은 얼마나 견고한가?
주요 결과
- 제안된 다중 작업 학습 모델은 기준 모델(예: 구글의 Perspective API 포함)에 비해 소수자 정체성을 언급하는 비폭력적 댓글의 평균 폭력성 점수를 10% 낮췄다.
- 비폭력적 정체성 언급 댓글에서는 모델이 폭력성 점수를 0.40을 초과로 예측한 적이 없었으며, 이는 잘못된 양성 예측의 강력한 완화를 의미한다.
- 폭력적 댓글에서는 모델이 항상 0.80 이상의 점수를 예측하여 실제 폭력성에 대한 민감도가 높다는 것을 보여주었다.
- 얕은 학습 및 깊은 학습 기준 모델 대비 의도하지 않은 편향 감소 측면에서 뛰어난 성능을 보였으며, 특히 게이, 블랙, 무슬림, 유대교 신자와 같은 정체성에서 두드러졌다.
- Google의 Perspective API는 '게이', 'Lesbian', '비세대'를 언급하는 댓글에서 예상보다 높은 폭력성 점수를 기록하여 이 정체성 집단에 대해 측정 가능한 편향을 보임을 시사했다.
- 주의 메커니즘이 더 나은 맥락 이해를 가능하게 하여, 순수한 정체성 언급와 실제 폭력적 콘텐츠를 더 효과적으로 구분할 수 있도록 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.