Skip to main content
QUICK REVIEW

[논문 리뷰] On Analyzing Annotation Consistency in Online Abusive Behavior Datasets

Rabiul Awal, Rui Cao|arXiv (Cornell University)|2020. 06. 24.
Hate Speech and Cyberbullying Detection참고 문헌 9인용 수 10
한 줄 요약

이 논문은 다수의 분류기를 훈련시켜 논란이 있는 트윗을 식별하고, 의미적으로 유사한 트윗을 검색하여 레이블 불일치를 표시하는 이단계 분석 프레임워크를 제안한다. 연구 결과, 특히 FOUNTA 데이터셋에서 동일한 리트윗이 일관되지 않게 레이블링되어 있어 혐오 발언 연구를 위한 데이터셋 신뢰성에 심각한 영향을 미친다.

ABSTRACT

Online abusive behavior is an important issue that breaks the cohesiveness of online social communities and even raises public safety concerns in our societies. Motivated by this rising issue, researchers have proposed, collected, and annotated online abusive content datasets. These datasets play a critical role in facilitating the research on online hate speech and abusive behaviors. However, the annotation of such datasets is a difficult task; it is often contentious on what should be the true label of a given text as the semantic difference of the labels may be blurred (e.g., abusive and hate) and often subjective. In this study, we proposed an analytical framework to study the annotation consistency in online hate and abusive content datasets. We applied our proposed framework to evaluate the consistency of the annotation in three popular datasets that are widely used in online hate speech and abusive behavior studies. We found that there is still a substantial amount of annotation inconsistency in the existing datasets, particularly when the labels are semantically similar.

연구 동기 및 목표

  • 온라인 폭력적 행동 데이터셋에서의 레이블 불일치 문제로 인한 혐오 발언 탐지 모델 신뢰성 저하라는 핵심 과제를 해결하기 위해.
  • 기존 데이터셋 내에서 논란이 있는 잠재적으로 잘못 레이블링된 트윗을 체계적으로 식별하기 위한 프레임워크를 개발하기 위해.
  • 세 가지 널리 사용되는 데이터셋인 WZ, DT, FOUNTA에서의 레이블 품질을 경험적으로 평가하기 위해.
  • 특히 '혐오'와 '공격적'과 같은 밀접하게 관련된 레이블 간의 의미적 유사성과 레이블 모호성이 레이블 불일치에 미치는 영향을 규명하기 위해.
  • 미래 연구에서 데이터 전처리 및 모델 훈련을 향상시키기 위해 레이블 불일치를 고려한 주석 처리된 데이터셋을 연구자들에게 제공하기 위해.

제안 방법

  • 각 데이터셋에 대해 다섯 가지 서로 다른 텍스트 분류기를 훈련시켜 트윗 레이블을 예측하고, 다수결 투표를 통해 논란이 있는 트윗을 식별한다.
  • 투표 메커니즘을 통해 절반 이상의 분류기가 잘못 분류한 트윗을 '논란이 있는'으로 표시하여 잠재적인 레이블 모호성을 나타낸다.
  • 의미적 임베딩 유사도 기반의 검색 엔진을 사용하여 각 논란이 있는 트윗과 가장 유사한 트윗을 검색한다.
  • 각 논란이 있는 트윗의 레이블과 가장 유사하게 검색된 트윗의 레이블을 비교하여 레이블 불일치 행렬을 구성한다.
  • 논란이 있는 트윗과 가장 유사한 트윗의 레이블이 다를 경우, 잠재적인 레이블 오류로 간주하고 이를 경고한다.
  • 특히 FOUNTA 데이터셋에서 레이블이 상이한 리트윗 사례를 중심으로 수작업 점검을 통해 불일치를 검증한다.

실험 결과

연구 질문

  • RQ1WZ, DT, FOUNTA와 같은 널리 사용되는 온라인 폭력적 행동 데이터셋에서 레이블 불일치가 어느 정도 존재하는가?
  • RQ2예를 들어 '혐오' 대비 '공격적'과 같은 레이블 간의 의미적 유사성이 레이블 불일치에 어떤 영향을 미치는가?
  • RQ3동일하거나 거의 동일한 리트윗은 특히 FOUNTA 데이터셋에서 레이블 불일치를 유발하는 데 어떤 역할을 하는가?
  • RQ4분류기 기반의 투표 메커니즘이 레이블 모호성으로 인해 잘못 레이블링될 가능성이 있는 논란이 있는 트윗을 효과적으로 식별할 수 있는가?
  • RQ5분석된 데이터셋에서 다양한 레이블 카테고리(예: 혐오, 폭력적, 공격적) 간의 불일치 수준은 어떻게 달라지는가?

주요 결과

  • FOUNTAIN 데이터셋은 가장 높은 수준의 레이블 불일치를 보이며, 758개의 논란이 있는 폭력적 트윗 중 가장 유사한 트윗은 '정상'으로 레이블링되어 있다.
  • FOUNTAIN 데이터셋에서 10퍼센트 이상의 트윗이 리트윗이며, 이들 중 동일하거나 거의 동일한 트윗들이 서로 다른 응답자에 의해 일관되지 않게 레이블링되어 있다.
  • WZ 데이터셋의 경우, 논란이 있는 것으로 식별된 1,407개의 성별 차별적 트윗 중 745개는 가장 유사한 트윗이 '중립'으로 레이블링되어 있어 잠재적인 잘못된 레이블링을 시사한다.
  • DT 데이터셋에서는 1,089개의 혐오 발언 트윗 중 842개가 논란이 있는 것으로 표시되었고, 이들 중 가장 유사한 트윗은 '공격적'으로 레이블링되어 있어 혐오와 공격적 콘텐츠 간의 혼동을 드러낸다.
  • 동일한 리트윗이 한 경우는 '혐오'로, 다른 경우는 '정상'으로 레이블링된 구체적인 사례를 식별하여 FOUNTA의 주석 전략에 심각한 결함이 있음을 폭 드러낸다.
  • 분석 프레임워크는 불일치를 성공적으로 탐지하고 정량화하였으며, 레이블 모호성과 의미적 유사성이 레이블 신뢰성에 중대한 영향을 미친다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.