Skip to main content
QUICK REVIEW

[논문 리뷰] Six Attributes of Unhealthy Conversation

Ilan Price, Jordan Gifford-Moore|arXiv (Cornell University)|2020. 10. 14.
Hate Speech and Cyberbullying Detection참고 문헌 28인용 수 8
한 줄 요약

이 논문은 약 44,000개의 커뮤니티 라벨링된 온라인 댓글로 구성된 Unhealthy Comment Corpus(UCC)를 소개한다. 이는 적대성, 대립성, 무시성, 경멸성, 비꼬임, 부당한 일반화와 같은 여섯 가지 미묘한 비폭력적이나 해로운 대화적 특성에 대해 주어진 데이터셋이다. 신뢰도 점수와 다중 특성 유형 분류를 통해 폭력적인 표현 외의 불건전한 대화를 더 잘 탐지할 수 있도록 하였으며, 최적화된 BERT 모델이 커뮤니티 라벨러의 합의를 뛰어넘는 성능을 보였다.

ABSTRACT

We present a new dataset of approximately 44000 comments labeled by crowdworkers. Each comment is labelled as either 'healthy' or 'unhealthy', in addition to binary labels for the presence of six potentially 'unhealthy' sub-attributes: (1) hostile; (2) antagonistic, insulting, provocative or trolling; (3) dismissive; (4) condescending or patronising; (5) sarcastic; and/or (6) an unfair generalisation. Each label also has an associated confidence score. We argue that there is a need for datasets which enable research based on a broad notion of 'unhealthy online conversation'. We build this typology to encompass a substantial proportion of the individual comments which contribute to unhealthy online conversation. For some of these attributes, this is the first publicly available dataset of this scale. We explore the quality of the dataset, present some summary statistics and initial models to illustrate the utility of this data, and highlight limitations and directions for further research.

연구 동기 및 목표

  • 미묘한 비폭력적이나 해로운 온라인 행동에 대한 대규모 고품질 데이터셋의 부족을 해결하기 위해.
  • 명백한 폭력성 외의 '불건전한' 대화 특성에 대한 종합적인 유형 체계를 개발하기 위해.
  • 자동화된 모더레이션, 사용자에게 경고를 주는 것, 맥락 인식 기반 대화 품질 평가 연구를 가능하게 하기 위해.
  • 고품질의 신뢰도 점수를 부여한 레이블을 통해 미묘한 형태의 온라인 무례함 탐지에 모델 성능을 향상시키기 위해.
  • 공정성과 대표성 향상을 위한 향후 연구를 안내하기 위해 데이터 수집 및 레이블링 과정에서의 편향을 드러내기 위해.

제안 방법

  • 커뮤니티 라벨러들이 캐나다 뉴스 사이트의 댓글들을 대상으로 불건전한 대화의 여섯 가지 하위 특성(적대성, 대립성, 무시성, 경멸성, 비꼬임, 부당한 일반화)에 대해 레이블링하였다.
  • 각 레이블에는 라벨러의 확신도를 반영하기 위해 0.5에서 1.0 사이의 신뢰도 점수가 부여되었다.
  • 플랫폼을 통해 제한된 인구통계학적 데이터를 가진 라벨러들이 선발되었으며, 신뢰도 점수를 활용해 레이블에 가중치를 주었다.
  • 기존의 BERT 모델을 미세조정하여 데이터셋에서 기준 성능을 확보하기 위해 학습 및 평가를 수행하였다.
  • 재현 가능성을 높이고 향후 연구를 지원하기 위해 데이터셋을 GitHub에 오픈소스로 공개하였다.
  • 품질 관리를 위해 상호 라벨러 간 일致도 검사와 레이블 일관성 검증을 실시하였다.

실험 결과

연구 질문

  • RQ1다중 특성 유형 체계는 온라인 대화에서 미묘한 비폭력적이나 해로운 행동을 효과적으로 포괄할 수 있는가?
  • RQ2실제 댓글 데이터에서 여섯 가지 불건전한 특성들이 명백한 폭력성과 상호 간에 어떻게 관련되어 있는가?
  • RQ3예를 들어, 미세조정된 BERT와 같은 기계학습 모델이 이러한 미묘한 특성을 탐지하는 데서 인간의 합의를 뛰어넘을 수 있는가?
  • RQ4라벨러의 인구통계학적 특성과 맥락 제시 방식의 편향이 레이블 신뢰도와 모델 일반화에 어떤 영향을 미치는가?
  • RQ5실제 모더레이션 시스템 구현에 영향을 줄 수 있는 주요 제약 조건과 의도치 않은 편향은 무엇인가?

주요 결과

  • UCC는 약 44,000개의 댓글을 포함하며, 여섯 가지 불건전한 대화 특성에 대한 이진 레이블과 관련된 신뢰도 점수를 제공하여, 현재까지 제공된 유사한 데이터셋 중 가장 큰 편이다.
  • 여섯 가지 특성들은 명백한 폭력성과 거의 독립적이며, 이는 불건전한 대화의 별개의 차원을 나타낸다.
  • 미세조정된 BERT 모델은 커뮤니티 라벨러의 합의를 뛰어넘는 성능을 달성하여, 자동 탐지의 잠재력을 보여주었다.
  • 복잡하고 주관적인 특성에 대해서는 상호 라벨러 간 일致도가 낮아, 미묘한 언어적 행동에 대한 일관된 레이블링의 과제를 드러냈다.
  • 이 데이터셋은 무시성과 부당한 일반화가 기존 데이터셋에서 다루지 못한 채로 널리 퍼져 있음을 보여주며, 이 코퍼스의 신선함을 입증한다.
  • 라벨러의 신뢰도 점수는 레이블의 정확도를 향상시켰으며, 주관적인 작업에서 신뢰도 지표를 통합하는 것이 유의미한 가치가 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.