Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding and Detecting Hateful Content using Contrastive Learning

Felipe González-Pizarro, Savvas Zannettou|arXiv (Cornell University)|2022. 01. 21.
Hate Speech and Cyberbullying Detection인용 수 5
한 줄 요약

이 논문은 4chan의 /pol/ 게시판에서 텍스트 및 이미지의 혐오 발언을 탐지하기 위해 대조학습 기반 다중모달 모델인 OpenAI의 CLIP을 사용하는 것을 제안한다. Google의 Perspective API와 수동 주석을 활용해 420개의 혐오 발언을 식별한 결과, 21,000개의 가능성이 높은 혐오 이미지와 246,000개의 혐오 발언을 포함한 게시물을 탐지했으며, F1 스코어 0.54를 기록하여 두 가지 기준 모델보다 혐오 이미지 탐지에서 뛰어난 성능을 보였다.

ABSTRACT

The spread of hate speech and hateful imagery on the Web is a significant problem that needs to be mitigated to improve our Web experience. This work contributes to research efforts to detect and understand hateful content on the Web by undertaking a multimodal analysis of Antisemitism and Islamophobia on 4chan's /pol/ using OpenAI's CLIP. This large pre-trained model uses the Contrastive Learning paradigm. We devise a methodology to identify a set of Antisemitic and Islamophobic hateful textual phrases using Google's Perspective API and manual annotations. Then, we use OpenAI's CLIP to identify images that are highly similar to our Antisemitic/Islamophobic textual phrases. By running our methodology on a dataset that includes 66M posts and 5.8M images shared on 4chan's /pol/ for 18 months, we detect 173K posts containing 21K Antisemitic/Islamophobic images and 246K posts that include 420 hateful phrases. Among other things, we find that we can use OpenAI's CLIP model to detect hateful content with an accuracy score of 0.81 (F1 score = 0.54). By comparing CLIP with two baselines proposed by the literature, we find that CLIP outperforms them, in terms of accuracy, precision, and F1 score, in detecting Antisemitic/Islamophobic images. Also, we find that Antisemitic/Islamophobic imagery is shared in a similar number of posts on 4chan's /pol/ compared to Antisemitic/Islamophobic textual phrases, highlighting the need to design more tools for detecting hateful imagery. Finally, we make available (upon request) a dataset of 246K posts containing 420 Antisemitic/Islamophobic phrases and 21K likely Antisemitic/Islamophobic images (automatically detected by CLIP) that can assist researchers in further understanding Antisemitism and Islamophobia.

연구 동기 및 목표

  • 대조학습 기반의 대규모 미리 훈련된 모델이 텍스트 및 이미지 전반에 걸쳐 혐오 콘텐츠를 탐지할 수 있는지 조사하기.
  • 기존 기준 모델과 비교해 CLIP의 반세미트주의 및 반무슬림주의 이미지 탐지 성능 평가하기.
  • 4chan의 /pol/ 게시판에서 혐오적 텍스트 및 시각 콘텐츠의 보편성 이해하기.
  • 미래 연구를 위해 246,000개의 게시물(420개의 혐오 발언 포함), 21,000장의 가능성이 높은 혐오 이미지가 포함된 데이터셋 공개하기.
  • 자동화된 혐오 콘텐츠 탐지에서 잠재적 한계점인 오진, 모델 편향, 입력 문장 구조 민감성 등 부각하기.

제안 방법

  • 4chan의 /pol/ 게시판에서 6600만 개의 게시물에서 반세미트주의 및 반무슬림주의 텍스트 발언 420개를 식별하기 위해 Google의 Perspective API와 수동 주석을 활용했다.
  • 텍스트와 이미지를 동일한 벡터 공간에 임bedding하는 대조학습 기반의 OpenAI CLIP 모델을 적용해, 식별된 혐오 발언과 유사한 이미지를 탐지했다.
  • 혐오 발언과 높은 유사도 점수를 기록한 21,000개의 이미지를 확보했으며, 이는 반세미트주의 또는 반무슬림주의 콘텐츠일 가능성이 높음을 시사한다.
  • 표준 평가 지표를 사용해 CLIP의 성능을 평가했으며, 정확도(0.81), 정밀도(0.54), 재현율(0.53), F1(0.54)을 기록했다.
  • CLIP의 성능을 기존 두 기준 모델과 비교했으며, 혐오 이미지 탐지에서 모든 평가 지표에서 CLIP가 뛰어난 성능을 보였다.
  • 오진, 모델 편향(예: 무슬림을 테러와 연관지움), 긴 텍스트 입력에 대한 민감성 등의 문제를 파악하기 위해 수동 분석을 수행했다.

실험 결과

연구 질문

  • RQ1CLIP와 같은 대규모 미리 훈련된 모델이 수용 가능한 성능으로 혐오 콘텐츠를 탐지할 수 있으며, 기존 최고 수준의 혐오 이미지 분류기와 비교해 어떻게 성능을 내는가?
  • RQ24chan의 /pol/ 게시판에서 반세미트주의 및 반무슬림주의 텍스트 발언과 이미지는 얼마나 보편적인가?
  • RQ3입력 문장 길이와 이미지 복잡도에 따라 CLIP의 성능은 어떻게 변하는가? 특히 이미지에 많은 텍스트가 포함된 경우에 대해 어떻게 되는가?
  • RQ4혐오 콘텐츠 탐지 시 CLIP에 내재된 편향은 무엇이며, 이는 탐지 신뢰성에 어떤 영향을 미치는가?
  • RQ5오진이 CLIP 및 공개된 데이터셋의 후속 연구 활용 가능성에 얼마나 큰 영향을 미치는가?

주요 결과

  • CLIP는 반세미트주의 및 반무슬림주의 이미지 탐지에서 F1 스코어 0.54를 기록했으며, 정확도 0.81, 정밀도 0.54, 재현율 0.53를 기록했다.
  • 혐오 이미지 탐지에서 CLIP는 정확도, 정밀도, F1 스코어 등 모든 평가 지표에서 두 기준 모델보다 뛰어난 성능을 보였다.
  • 이 방법을 통해 반세미트주의 및 반무슬림주의 텍스트 발언 420개를 포함한 246,000개의 게시물과 가능성이 높은 혐오 이미지 21,000개를 탐지했다.
  • /pol/ 게시판에서 반세미트주의 및 반무슬림주의 이미지의 보편성와 텍스트 발언의 보편성이 유사한 수준이므로, 시각적 혐오 콘텐츠 탐지 도구의 개선이 시급하다는 점을 시사한다.
  • CLIP는 입력 문장 길이에 매우 민감했으며, 긴 문장에서는 성능이 크게 저하되었고, 텍스트가 많은 이미지에서는 특히 그러한 경향이 뚜렷했다.
  • 공개된 데이터셋에는 다수의 오진이 포함되어 있으며, 향후 작업에서 노이즈를 줄이기 위해 추가적인 수동 주석 작업이 필요할 것으로 예상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.