Skip to main content
QUICK REVIEW

[논문 리뷰] SOLID: A Large-Scale Semi-Supervised Dataset for Offensive Language Identification

Sara Brin Rosenthal, Pepa Atanasova|arXiv (Cornell University)|2020. 04. 29.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 논문은 OLID 데이터셋을 시드로 삼아 앙상블 준지도 학습을 적용하여 커버리지 확장을 도모한, 900만 개의 영어 트윗으로 구성된 대규모 준지도 학습 데이터셋인 SOLID를 소개한다. SOLID에서 모델을 미세조정하고 OLID에서 평가할 경우, 특히 계층 분류의 하위 수준에서 뚜렷한 성능 향상을 기록하며, 자원이 부족한 공격적 언어 탐지 작업에 효과적임을 입증한다.

ABSTRACT

The widespread use of offensive content in social media has led to an abundance of research in detecting language such as hate speech, cyberbullying, and cyber-aggression. Recent work presented the OLID dataset, which follows a taxonomy for offensive language identification that provides meaningful information for understanding the type and the target of offensive messages. However, it is limited in size and it might be biased towards offensive language as it was collected using keywords. In this work, we present SOLID, an expanded dataset, where the tweets were collected in a more principled manner. SOLID contains over nine million English tweets labeled in a semi-supervised fashion. We demonstrate that using SOLID along with OLID yields sizable performance gains on the OLID test set for two different models, especially for the lower levels of the taxonomy.

연구 동기 및 목표

  • 계층적 분류의 하위 수준에서 특히 라벨이 부족한 공격적 언어 데이터의 부족 문제를 해결하기 위해.
  • 비용이 많이 들는 수동 주석에 의존하지 않고도 대규모 공격적 언어 데이터를 확보할 수 있는 확장 가능하고 비용 효율적인 방법을 개발하기 위해.
  • 암시적 또는 암묵적인 공격적 내용에 특히 유리한 성능 향상을 지원하는 공개 가능한 대규모 데이터셋을 만들기 위해.
  • 자주 사용하는 정지어를 쿼리 텀으로 사용하고 다양한 인덕티브 바이어스를 가진 앙상블 모델을 활용하여 데이터 수집 시 편향을 줄이기 위해.
  • 더 큰, 더 대표성 있는 학습 분포를 통해 공격적 언어 탐지 시스템의 일반화 능력과 강건성을 향상시키기 위해.

제안 방법

  • 저자는 준지도 학습의 시드로 OLID 데이터셋을 사용하고, 학습 데이터를 확장하기 위해 다단계 파이프라인을 적용한다.
  • 자연어 사용의 광범위하고 대표적인 커버리지를 확보하기 위해 자주 사용하는 정지어를 쿼리 텀으로 삼아 트윗을 수집한다.
  • 다양한 사전 학습된 언어 모델의 앙상블을 OLID 시드 데이터로 훈련시켜 수백만 개의 레이블이 없는 트윗에 대한 레이블 예측을 수행한다.
  • 신뢰도 기준과 공통의 투표를 통해 예측 결과를 필터링하고 집계하여 노이즈와 편향을 줄인다.
  • 최종 데이터셋인 SOLID는 900만 개의 영어 트윗을 포함하며, 세 수준의 계층적 레이블을 가진다: 공격적 언어 탐지, 유형 분류, 대상 식별.
  • SOLID에서 미세조정한 모델이 OLID 테스트 세트에서의 성능을 비교함으로써 준지도 학습 레이블의 품질을 검증한다.

실험 결과

연구 질문

  • RQ1학습 데이터가 제한된 상황에서 준지도 학습이 공격적 언어 탐지 성능을 뚜렷이 향상시킬 수 있는가?
  • RQ2시드 데이터셋과 모델 앙상블을 활용해 학습 데이터를 확장할 경우, 특히 저자원 계층 분류 수준에서 일반화 능력이 향상되는가?
  • RQ3준지도 학습 레이블의 품질이 골드 표준 주석과 비교해 모델 성능과 편향 완화 측면에서 어떻게 다른가?
  • RQ4SOLID와 같이 대규모인 데이터셋이, 작은 수의 수동 컬렉션에 비해 암시적 공격적 내용(예: 비꼬임, 암묵적 비하 표현) 탐지에 유리한가?
  • RQ5초기 쿼리 텀의 선택(예: 정지어 대비 关련 키워드)이 최종 데이터셋의 대표성과 편향에 얼마나 큰 영향을 미치는가?

주요 결과

  • SOLID에서 모델을 미세조정하면 OLID 테스트 세트에서 성능 향상이 뚜렷하게 나타나며, 특히 기존 데이터셋에서 자원이 부족한 계층 분류의 하위 수준에서 두드러진다.
  • 성능 향상은 특히 대상 식별 수준(Lv. C)에서 가장 두드러지며, 이는 학습 인스턴스 수가 가장 적은 수준이므로 준지도 학습 확장의 효과를 잘 보여준다.
  • 단일 모델 예측에 비해 앙상블 준지도 학습 접근법이 예측 노이즈와 편향을 줄여주며, 이는 높은 상호 주석자 일치도와 다양한 모델 아키텍처에 대한 강건성을 통해 입증된다.
  • 데이터셋은 EASY(명시적)와 HARD(암묵적) 공격적 예제에 대한 종합적 분석을 포함하며, SOLID에서 훈련된 모델이 암묵적 또는 간접적인 형태의 공격에 더 잘 일반화됨을 보여준다.
  • SOLID의 공격적 대비 비공격적 트윗 비율이 키워드 기반 데이터셋보다 더 균형 잡히고 대표적이며, 선택 편향을 줄여준다.
  • 이 데이터셋은 공개되었으며, SemEval-2020 OffensEval 공동 과제의 공식 훈련 세트로 채택되어 연구 공동체 내에서의 유용성과 신뢰성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.