Skip to main content
QUICK REVIEW

[논문 리뷰] Session-based Cyberbullying Detection in Social Media: A Survey

Peiling Yi, Arkaitz Zubiaga|arXiv (Cornell University)|2022. 07. 14.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 종합 검토는 사회적 미디어 상호작용에서 반복적 행동과 권력 불균형을 모델링하는 세션 기반 사이버불링 탐지 프레임워크를 제안한다. 데이터, 방법론, 데이터셋 구축을 위한 최선의 실천 방안을 검토하고, 두 개의 데이터셋에서 최신 모델 및 대규모 언어 모델을 벤치마킹하며, 세션 수준의 사이버불링 탐지 분야의 향후 연구를 위한 핵심 과제를 규명한다.

ABSTRACT

Cyberbullying is a pervasive problem in online social media, where a bully abuses a victim through a social media session. By investigating cyberbullying perpetrated through social media sessions, recent research has looked into mining patterns and features for modeling and understanding the two defining characteristics of cyberbullying: repetitive behavior and power imbalance. In this survey paper, we define the Session-based Cyberbullying Detection framework that encapsulates the different steps and challenges of the problem. Based on this framework, we provide a comprehensive overview of session-based cyberbullying detection in social media, delving into existing efforts from a data and methodological perspective. Our review leads us to propose evidence-based criteria for a set of best practices to create session-based cyberbullying datasets. In addition, we perform benchmark experiments comparing the performance of state-of-the-art session-based cyberbullying detection models as well as large pre-trained language models across two different datasets. Through our review, we also put forth a set of open challenges as future research directions.

연구 동기 및 목표

  • 사회적 미디어 상호작용에서 반복적 행동과 권력 불균형을 포착하는 표준화된 세션 기반 사이버불링 탐지 프레임워크를 정의하기.
  • 다양한 사회적 미디어 플랫폼에서 세션 기반 사이버불링 탐지에 대한 기존 데이터 소스와 방법론을 검토하기.
  • 고품질이며 대표적인 세션 기반 사이버불링 데이터셋을 구축하기 위한 증거 기반 기준을 설정하기.
  • 두 개의 공개 데이터셋에서 최신 세션 기반 모델과 대규모 미리 훈련된 언어 모델을 벤치마킹하기.
  • 세션 기반 사이버불링 탐지 분야에서의 열린 과제와 향후 연구 방향을 규명하기.

제안 방법

  • 본 논문은 세션 기반 사이버불링 탐지 과정을 데이터 수집, 특징 공학, 모델링, 평가 단계로 분해하는 체계적인 프레임워크를 도입한다.
  • 반복적 행동과 권력 불균형을 모델링하기 위해 메시지 순서 패턴, 언어적 신호, 상호작용 동역학성과 같은 세션 수준의 특징을 분석한다.
  • 세션 분할, 레이블 일관성, 벌레-희생자 관계에서의 데이터 균형을 포함한 데이터셋 구축을 위한 일련의 최선의 실천 방안을 제안한다.
  • 두 개의 공개 데이터셋에서 최신 순차 모델(예: RNN, Transformer)과 대규모 미리 훈련된 언어 모델(예: BERT)을 사용해 벤치마킹을 수행한다.
  • 모델 성능을 서로 다른 세션 구성 간에 비교하기 위해 F1 점수, 정밀도, 재현율과 같은 표준 NLP 메트릭을 평가에 사용한다.
  • 계산 언어학, 사회심리학, NLP의 통찰을 통합하여 방법론적 및 윤리적 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1반복적 행동과 권력 불균형을 활용해 세션 기반 사이버불링을 효과적으로 모델링할 수 있는 표준화된 프레임워크는 어떻게 설계될 수 있는가?
  • RQ2신뢰할 수 있는 세션 기반 사이버불링 탐지 데이터셋을 구축하는 데 있어 핵심적인 데이터 및 방법론적 과제는 무엇인가?
  • RQ3최신 순차 모델과 대규모 미리 훈련된 언어 모델은 세션 기반 사이버불링 탐지 작업에서 어떻게 성능을 발휘하는가?
  • RQ4고품질이며 대표적인 세션 기반 사이버불링 데이터셋을 구축하는 데 지침이 되는 증거 기반 기준은 무엇인가?
  • RQ5세션 기반 사이버불링 탐지 분야에서 주요한 열린 과제와 향후 연구 방향은 무엇인가?

주요 결과

  • 제안된 세션 기반 탐지 프레임워크는 체계적인 세션 모델링을 통해 사이버불링의 시간적 및 관계적 역학을 효과적으로 포착한다.
  • 벤치마킹 결과, 대규모 미리 훈련된 언어 모델이 일반적으로 전통적 순차 모델보다 세션 기반 사이버불링 탐지 작업에서 뛰어난 성능을 보인다.
  • 연구는 데이터셋 간에 뚜렷한 성능 변동성을 규명하며, 표준화된 평가 프rotocol의 필요성을 강조한다.
  • 증거 기반 데이터셋 구축 기준은 향후 연구에서 데이터 품질, 일관성, 재현 가능성을 향상시킨다.
  • 긴 세션 처리, 미묘한 권력 불균형 탐지, 다양한 사회적 미디어 플랫폼 간 모델 일반화 보장 등의 핵심 과제가 여전히 남아 있다.
  • 본 종합 검토는 더 강력한 탐지 시스템을 위해 사회심리학적 통찰과 NLP 기법을 통합하는 중요성을 부각시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.