[논문 리뷰] Are Chess Discussions Racist? An Adversarial Hate Speech Data Set
이 논문은 체스 게임 어휘에 포함된 인종적 용어로 인해 상용 hate-speech 분류기가 유해 발언으로 간주되지 않는 체스 논의를 잘못 분류하는지 조사한다. 유튜브 체스 채널의 681,995개 댓글로 구성된 데이터셋을 사용하여 저자들은 분류기에 의해 잘못 경고된 1,000개의 인간 검증된 비유해 발언 댓글을 식별하였으며, 이는 도메인 강인성에 심각한 실패를 드러내고 NLP 모델에서의 체계적 색채 다의어 현상을 규명한다.
On June 28, 2020, while presenting a chess podcast on Grandmaster Hikaru Nakamura, Antonio Radić's YouTube handle got blocked because it contained "harmful and dangerous" content. YouTube did not give further specific reason, and the channel got reinstated within 24 hours. However, Radić speculated that given the current political situation, a referral to "black against white", albeit in the context of chess, earned him this temporary ban. In this paper, via a substantial corpus of 681,995 comments, on 8,818 YouTube videos hosted by five highly popular chess-focused YouTube channels, we ask the following research question: \emph{how robust are off-the-shelf hate-speech classifiers to out-of-domain adversarial examples?} We release a data set of 1,000 annotated comments where existing hate speech classifiers misclassified benign chess discussions as hate speech. We conclude with an intriguing analogy result on racial bias with our findings pointing out to the broader challenge of color polysemy.
연구 동기 및 목표
- 체스 관련 논의에서 인종적 용어로 인해 상용 hate-speech 분류기가 유해 발언으로 잘못 분류하는지 조사하기 위해.
- 특히 체스 코멘터리와 같은 도메인 외부 콘텐츠에 적용했을 때 상용 hate-speech 분류기의 강인성 검토하기 위해.
- 특히 '화이트'와 '블랙' 같은 어휘의 모호성이 hate-speech 탐지에서 잘못된 경고를 유발하는 방식을 분석하기 위해.
- 다양한 텍스트 도메인에서의 유사성 테스트를 통해 단어 임베딩 편향의 더 넓은 영향 분석하기 위해.
- 향후 악성 예제 및 NLP에서의 편향성 연구를 위해 1,000개의 잘못 분류된 체스 댓글로 구성된 정제된 데이터셋 공개하기 위해.
제안 방법
- 유튜브 API를 사용하여 다섯 개인 체스 채널의 8,818개 유튜브 영상에서 681,995개의 댓글을 수집하였다.
- 두 가지 사전 훈련된 hate-speech 분류기를 적용: 하나는 트위터 데이터에 맞춤 조정된 모델($\mathcal{M}_{\mathit{twitter}}$)이고, 다른 하나는 백인 우월주의 포럼 데이터셋에 맞춤 조정된 모델($\mathcal{M}_{\mathit{stormfront}}$)이다.
- 최소한 하나의 분류기에 의해 유해 발언으로 경고된 1,000개의 무작위 샘플 댓글을 인간이 수작업으로 레이블링하여 진정한 레이블을 확인하였다.
- 체스, 폭스 뉴스, CNN 댓글 데이터셋의 단어 임베딩에서 유사성 테스트(예: '블랙' : '슬레이브' :: '화이트' : ?)를 수행하여 의미적 편향을 평가하였다.
- 인간 검증 기준을 사용하여 잘못된 양성률을 정량화하고, 다양한 도메인에서 분류기 성능을 평가하였다.
- 잘못된 경고의 패턴을 식별하기 위해 '공격', '위협', '캐처', 색조어 등의 언어적 촉매를 분석하였다.
실험 결과
연구 질문
- RQ1상용 hate-speech 분류기가 얼마나 자주 유해 발언이 아닌 체스 논의를 잘못 분류하는가?
- RQ2특히 체스 관련 콘텐츠에 적용했을 때 hate-speech 분류기의 성능이 도메인에 따라 어떻게 달라지는가?
- RQ3특히 색조어와 전투 은유와 같은 언어적 특징이 hate-speech 탐지에서 잘못된 양성으로 이어지는가?
- RQ4체스와 뉴스 등 다양한 도메인의 단어 임베딩이 유사성 추론에서 인종적 고정관념을 어떻게 반영하거나 왜곡하는가?
- RQ5체스 용어에서 '화이트'와 '블랙'의 맥락이 NLP 모델에서의 인종적 편향에 얼마나 기여하는가?
주요 결과
- 분류기에 의해 유해 발언으로 경고된 댓글 중 82.4%가 실제로는 유해 발언이 아니었으며, 이는 체스 논의에서 잘못된 양성률이 82.4%에 이르는 것으로 나타났다.
- 백인 우월주의 포럼 데이터셋에 훈련된 BERT 기반 분류기($\mathcal{M}_{\mathit{stormfront}}$)가 트위터 데이터셋에 훈련된 모델($\mathcal{M}_{\mathit{twitter}}$)보다 약간 낮은 잘못된 양성률을 보였으며, 이는 인종적 혐오 발언에 더 잘 맞는 도메인 일치도를 보여준다.
- 극단적인 혐오 콘텐츠에 훈련된 $\mathcal{M}_{\mathit{stormfront}}$ 모델조차도 체스 댓글의 82.4%를 잘못 유해 발언으로 분류했으며, 이는 도메인 외부 일반화 능력이 떨어짐을 보여준다.
- 유사성 테스트 '블랙 : 슬레이브 :: 화이트 : ?'에서 체스 데이터셋에서는 '슬레이브'가 유추되었고, 폭스 뉴스와 CNN 데이터셋에서는 '슬레이브마스터'가 예측되었으며, 이는 체스 맥락에서 인종적 권력 관계가 임베딩 내에서 정상화됨을 드러낸다.
- '화이트', '블랙', '공격', '위협', '캐처' 등의 용어가 잘못된 양성의 주요 촉매로 작용하였으며, 이는 어휘의 다의어가 잘못된 분류의 핵심 원인임을 시사한다.
- 심지어 맥락적으로 중립적인 도메인인 체스에서도 '화이트'와 '블랙'이 순수한 상징적 의미를 지니고 있음에도 불구하고, NLP 모델은 다의어와 편향된 사전 훈련 데이터로 인해 이들 용어를 인종적 권력 관계와 연결지어 해석함을 본 연구는 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.