[논문 리뷰] Contextualizing Hate Speech Classifiers with Post-hoc Explanation
이 논문은 BERT 기반의 혐오 발언 분류기에서 'Lesbian', 'Black'와 같은 집단 식별어에 대해 더 높은 맥락 민감도를 가지도록 하기 위해, 샘플링 및 차폐(Sampling and Occlusion, SOC) 방법에서 도출된 사후 설명을 사용하는 새로운 정규화 기법을 제안한다. 이 기법은 이러한 용어에 대한 과도한 의존도를 줄이고, 비인간화 언어와 같은 맥락적 신호에 더 많은 주의를 기울임으로써, 도메인 외부 데이터에서의 잘못된 양성 결과를 크게 감소시키면서도 도메인 내 성능을 유지하거나 향상시킨다.
Hate speech classifiers trained on imbalanced datasets struggle to determine if group identifiers like "gay" or "black" are used in offensive or prejudiced ways. Such biases manifest in false positives when these identifiers are present, due to models' inability to learn the contexts which constitute a hateful usage of identifiers. We extract SOC post-hoc explanations from fine-tuned BERT classifiers to efficiently detect bias towards identity terms. Then, we propose a novel regularization technique based on these explanations that encourages models to learn from the context of group identifiers in addition to the identifiers themselves. Our approach improved over baselines in limiting false positives on out-of-domain data while maintaining or improving in-domain performance. Project page: https://inklab.usc.edu/contextualize-hate-speech/.
연구 동기 및 목표
- 비방적 맥락이 아닌 곳에서 'Lesbian'이나 'Black' 같은 집단 식별어가 나타날 때 혐오 발언 분류기가 잘못된 양성 결과를 내는 문제를 해결하기 위해.
- 불균형 데이터셋에서 높은 빈도로 나타나는 정체성 용어에 대한 과도한 의존도를 줄임으로써, 도메인 외부 데이터에서의 모델 일반화 능력을 향상시키기 위해.
- 데이터 증강이나 모델 재학습 없이도 정체성 용어의 맥락적 이해 능력을 향상시키는 정규화 기법을 개발하기 위해.
- 사후 설명 피드백을 미세조정된 BERT 모델에 통합하여, 더 일반화 가능한 혐오 발언 특징으로의 학습을 이끌기 위해.
제안 방법
- 미세조정된 BERT 분류기에서 집단 식별어에 대한 기능 중요도 점수를 추출하기 위해 사후 설명 알고리즘인 샘플링 및 차폐(Sampling and Occlusion, SOC)를 적용한다.
- SOC 설명을 통해 모델이 비인간화 언어와 같은 맥락적 특징보다 정체성 용어에 더 과도하게 주목하고 있음을 규명한다.
- 학습 중 정체성 용어에 할당된 높은 중요도를 처벌하는 새로운 정규화 손실을 제안하며, 이를 통해 모델이 주변 맥락에 더 집중하도록 유도한다.
- 표준 교차 엔트로피 손실과 SOC 설명 점수 기반의 정규화 항을 조합한 손실을 사용해 BERT 모델을 훈련한다.
- 비교를 위해 훈련 중에 정체성 용어를 입력에서 제거하는 단어 제거 베이스라인을 필터링한다.
- 도메인 내 혐오 발언 탐지 및 도메인 외 테스트 세트(예: NYT 코퍼스)에서의 모델 성능을 평가하여 잘못된 양성 결과 감소 정도를 측정한다.
실험 결과
연구 질문
- RQ1SOC에서 도출된 사후 설명이 혐오 발언 탐지에서 정체성 용어에 대한 모델 편향을 효과적으로 드러내는가?
- RQ2SOC 설명을 기반으로 한 정규화를 통해 정체성 용어에 대한 모델 주의 집중을 조정하면 도메인 외부 데이터에서 잘못된 양성 결과가 감소하는가?
- RQ3단어 제거와 비교했을 때, 사후 설명 기반 정규화는 도메인 내 혐오 발언 탐지 성능을 얼마나 잘 유지하는가?
- RQ4정규화가 얼마나 정확히 모델의 주의를 정체성 용어에서 더 일반화 가능한 혐오 발언 신호(예: 모욕어, 비인간화 표현)로 이동시키는가?
주요 결과
- SOC 설명 기반 정규화로 인해 도메인 외부 NYT 코퍼스에서 잘못된 양성률이 크게 감소하였으며, 이는 정체성 용어에 대한 과도한 의존도 감소 덕분이었다.
- 도메인 내 Gab Hate Corpus에서, 이 방법은 기준 BERT 모델과 비교해 F1 점수를 유지하거나 향상시켰다. 이는 성능 저하가 없음을 시사한다.
- 정규화 이후 SOC 설명의 변화를 측정한 결과, 모델이 '비난당했다', '독이 되었다', '비인간화' 등의 맥락적 혐오 발언 신호에 더 많은 주의를 기울이는 것으로 나타났다.
- 단어 제거와 비교했을 때, SOC 기반 정규화는 더 높은 재현율을 달성하여 실제 혐오 발언 탐지 능력을 손상시키지 않으면서도 편향을 완화하는 데 성공했다.
- 시각화 결과, 정규화가 잘못된 양성 결과를 수정하기 위해 모델의 정체성 용어 주의를 줄이고 맥락적 특징에 대한 민감도를 높였음을 확인했다.
- 이 방법은 데이터 증강이나 BERT 아키텍처의 변경 없이도 모델의 맥락 민감도를 성공적으로 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.