Skip to main content
QUICK REVIEW

[논문 리뷰] Abusive Language Detection with Graph Convolutional Networks

Pushkar Mishra, Marco Del Tredici|arXiv (Cornell University)|2019. 04. 05.
Hate Speech and Cyberbullying Detection참고 문헌 18인용 수 46
한 줄 요약

논문은 이질 그래프 접근법과 그래프 컨볼루션 네트워크를 도입하여 온라인 커뮤니티와 언어적 행동을 악성 언어 탐지에 모델링하고, 베이스라인보다 우수한 결과를 달성한다.

ABSTRACT

Abuse on the Internet represents a significant societal problem of our time. Previous research on automated abusive language detection in Twitter has shown that community-based profiling of users is a promising technique for this task. However, existing approaches only capture shallow properties of online communities by modeling follower-following relationships. In contrast, working with graph convolutional networks (GCNs), we present the first approach that captures not only the structure of online communities but also the linguistic behavior of the users within them. We show that such a heterogeneous graph-structured modeling of communities significantly advances the current state of the art in abusive language detection.

연구 동기 및 목표

  • 저자의 언어적 행동을 통합하여 순수하게 구조적 커뮤니티 특징만으로는 한정된 성능에서 벗어나야 함을 제시한다.
  • 사회적 구조와 텍스트 내용을 모두 포착하기 위한 두 그래프 표현(커뮤니티 그래프와 확장된 저자-트윗 그래프)을 제안한다.
  • 저자 프로필이 언어적 행동과 커뮤니티 구조를 반영하도록 학습하는 반지도 학습 기반 GCN 방법을 개발한다.
  • Waseem & Hovy의 트위터 데이터셋의 하위 집합을 사용하여 GCN 기반 방법을 강력한 베 baseline과 비교한다.
  • 실험을 통해 GCN 기반 저자 프로파일링이 기존 방법을 능가함을 입증한다.

제안 방법

  • 커뮤니티를 두 그래프로 표현한다: 동질적인 저자 그래프와 저자 및 트윗 노드가 포함된 확장 이기종 그래프.
  • 유사한 그래프에서의 node2vec를 베이스라인으로 사용하여 저자 프로필을 얻는다.
  • 확장 그래프에 두 계층의 그래프 컨볼루션 네트워크를 적용하여 모든 노드의 임베딩을 학습하고, 반지도 학습을 위해 라벨이 있는 트윗 노드를 활용한다.
  • 입력 특징은 이진 단어 집합(BOW) 벡터이며, 저자의 특징은 모든 트윗을 집계한다.
  • 라벨이 있는 트윗 노드에서 교차 엔트로피 손실로 학습하고, 첫 번째 GCN 계층에서 저자용 200차 임베딩을 추출한다.
  • 베이스라인과 비교: 문자 n-그램(lr), 두 그래프에서 node2vec로 얻은 저자 프로필을 사용하는 lr+auth, lr+extd, 그리고 lr+gcn.

실험 결과

연구 질문

  • RQ1저자들까지 포함하는 이질 그래프가 저자 전용 그래프를 넘어 악성 언어 탐지를 개선할 수 있는가?
  • RQ2GCN을 통한 언어 신호의 통합이 node2vec 베이스라인에 비해 저자 프로파일링과 트윗 분류를 향상시키는가?
  • RQ3GCN 기반 프로필은 인종 차별(racism), 성 차별(sexism), 그리고 전체 분류 지표에서 어떤 성능을 보이는가?

주요 결과

  • lr+gcn 방법이 다른 모든 방법을 통계적으로 유의하게 상회한다(p<0.05, 짝 t-검정).
  • GCN으로 얻은 저자 프로필은 커뮤니티 구조와 언어적 행동을 모두 반영하여 일반적인 저자 프로필이 놓치는 오분류를 해결한다.
  • GCN만으로는 성차별에서 높은 재현율은 보이나 정밀도가 낮고, 소수의 악성 저자가 혼합 콘텐츠를 기여하는 인종 차별의 문제를 해결하기 어렵다.
  • lr과 GCN을 결합한 lr+gcn은 트윗 수준의 문자 n-그램 특성을 포함시켜 인종 차별 문제를 완화한다.
  • 확장 그래프에서 node2vec 기반 저자 프로필은 커뮤니티 그래프만 사용한 경우보다 큰 이점을 제공하지 못한다( GC N 접근 방식과는 다름).
  • 전반적으로 lr+gcn은 인종 차별, 성 차별, 깔끔한(class)에서 매크로 평균 정밀도, 재현율, F1 모두에서 최고를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.