Skip to main content
QUICK REVIEW

[논문 리뷰] Bangla Text Dataset and Exploratory Analysis for Online Harassment Detection

Md. Faisal Ahmed, Zalish Mahmud|arXiv (Cornell University)|2021. 02. 04.
Hate Speech and Cyberbullying Detection인용 수 11
한 줄 요약

이 논문은 유명 인사들의 공개 게시물에서 수집한 44,001개의 페이스북 댓글로 구성된 공개 가능한 방글라어 텍스트 데이터셋을 소개한다. 이 데이터셋은 온라인 괴롭힘에 대해 주석 처리되어 있으며, 다양한 괴롭힘 유형에 대한 탐색적 분석을 제공한다. 이는 다중라벨 방글라어 NLP 자원의 부족을 해결하고, 방글라어와 같은 저자원 언어에서 사이버불링 및 부적절한 콘텐츠 탐지에 대한 연구를 가능하게 한다.

ABSTRACT

Being the seventh most spoken language in the world, the use of the Bangla language online has increased in recent times. Hence, it has become very important to analyze Bangla text data to maintain a safe and harassment-free online place. The data that has been made accessible in this article has been gathered and marked from the comments of people in public posts by celebrities, government officials, athletes on Facebook. The total amount of collected comments is 44001. The dataset is compiled with the aim of developing the ability of machines to differentiate whether a comment is a bully expression or not with the help of Natural Language Processing and to what extent it is improper if it is an inappropriate comment. The comments are labeled with different categories of harassment. Exploratory analysis from different perspectives is also included in this paper to have a detailed overview. Due to the scarcity of data collection of categorized Bengali language comments, this dataset can have a significant role for research in detecting bully words, identifying inappropriate comments, detecting different categories of Bengali bullies, etc. The dataset is publicly available at https://data.mendeley.com/datasets/9xjx8twk8p.

연구 동기 및 목표

  • 온라인 괴롭힘 탐지에 적합한 주석 처리된 방글라어 텍스트 데이터셋의 부족을 해결하기 위해.
  • 사이버불링 및 부적절한 콘텐츠 연구를 위한 실제 페이스북 댓글을 방글라어로 수집하고 주석 처리하기 위해.
  • 방글라어와 같은 저자원 언어의 NLP 연구를 지원하기 위해 공개 가능한 데이터셋을 제공하기 위해.
  • 방글라어 온라인 논의에서 괴롭힘 패턴과 언어적 특성에 대한 탐색적 분석을 수행하기 위해.
  • 방글라어에서 다양한 유형의 온라인 괴롭힘을 탐지하고 분류할 수 있는 기계학습 모델 개발을 가능하게 하기 위해.

제안 방법

  • 유명 인사, 정부 관계자, 스포츠 스타들의 공개 페이스북 게시물에서 댓글을 크롤링하였다.
  • 이 데이터셋은 44,001개의 방글라어 댓글로 구성되며, 수작업으로 여러 괴롭힘 유형에 주석 처리되었다.
  • 레이블링은 혐오 발언, 위협, 개인 공격 등 다양한 유형의 온라인 괴롭힘을 구분할 수 있도록 다중 클래스 체계에 따라 수행되었다.
  • 통계적 요약, 빈도 분포 및 시각화(표와 그림)를 활용한 탐색적 데이터 분석을 수행하였다.
  • 저자원 언어의 NLP 연구를 위한 재현 가능성을 높이기 위해 데이터셋을 공개적으로 배포하였다.
  • 공격적 언어 사용 패턴을 이해하기 위해 언어학적 및 사회언어학적 시각을 분석에 통합하였다.

실험 결과

연구 질문

  • RQ1방글라어 소셜미디어 댓글에서 퍼지기 쉬운 온라인 괴롭힘의 형태와 유형은 무엇인가?
  • RQ2방글라어에서 언어적 특성과 댓글 특성은 다양한 유형의 괴롭힘과 어떻게 관련이 있는가?
  • RQ3공개된 다중라벨 방글라어 데이터셋이 자동 괴롭힘 탐지 시스템 개발에 얼마나 기여할 수 있는가?
  • RQ4방글라어 온라인 논의에서 다양한 인구통계나 콘텐츠 기반 맥락에서 공격적 언어의 분포 패턴은 어떠한가?
  • RQ5저자원 언어 데이터셋의 탐색적 분석이 향후 방글라어를 위한 NLP 모델 설계에 어떻게 기여할 수 있는가?

주요 결과

  • 이 데이터셋은 44,001개의 방글라어 댓글을 포함하며, 여러 괴롭힘 유형에 대한 주석 처리를 통해 NLP 연구에 매우 풍부한 자원을 제공한다.
  • 탐색적 분석을 통해 다양한 괴롭힘 유형 간에 공격적 표현의 언어적 패턴과 빈도 분포의 명확한 차이가 드러났다.
  • 이 데이터셋은 혐오 발언, 개인 공격, 위협 등 괴롭힘의 심각성과 성격에 있어 뚜렷한 다양성을 보였다.
  • 이 데이터셋의 가용성은 특히 온라인 안전 및 콘텐츠 모니터링 분야에서 방글라어 NLP 분야의 핵심 격차를 메우고 있다.
  • 이 연구는 방글라어 텍스트의 대규모 실세계 주석 처리가 괴롭힘 탐지에 가능하다는 점을 입증하며, 향후 모델 훈련과 평가를 가능하게 한다.
  • 이 데이터셋은 제공된 URL을 통해 공개적으로 접근 가능하며, 재현 가능성과 커뮤니티 기반 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.