Skip to main content
QUICK REVIEW

[논문 리뷰] Vietnamese Hate and Offensive Detection using PhoBERT-CNN and Social Media Streaming Data

Khanh Tran, An Nguyen|arXiv (Cornell University)|2022. 06. 01.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 논문은 베트남어 혐오 및 모욕적 댓글 감지에 대해 향상된 데이터 전처리 및 EDA 기법을 결합한 PhoBERT-CNN 모델을 제안하며, ViHSD에서 F1 스코어 67.46%와 HSD-VLSP에서 98.45%의 성능을 기록했고, Apache Spark Structured Streaming를 활용한 실시간 스트리밍 기능을 통해 소셜 미디어 플랫폼에 실용적으로 구현 가능한 시스템을 제공한다.

ABSTRACT

Society needs to develop a system to detect hate and offense to build a healthy and safe environment. However, current research in this field still faces four major shortcomings, including deficient pre-processing techniques, indifference to data imbalance issues, modest performance models, and lacking practical applications. This paper focused on developing an intelligent system capable of addressing these shortcomings. Firstly, we proposed an efficient pre-processing technique to clean comments collected from Vietnamese social media. Secondly, a novel hate speech detection (HSD) model, which is the combination of a pre-trained PhoBERT model and a Text-CNN model, was proposed for solving tasks in Vietnamese. Thirdly, EDA techniques are applied to deal with imbalanced data to improve the performance of classification models. Besides, various experiments were conducted as baselines to compare and investigate the proposed model's performance against state-of-the-art methods. The experiment results show that the proposed PhoBERT-CNN model outperforms SOTA methods and achieves an F1-score of 67,46% and 98,45% on two benchmark datasets, ViHSD and HSD-VLSP, respectively. Finally, we also built a streaming HSD application to demonstrate the practicality of our proposed system.

연구 동기 및 목표

  • 혐오 발언 감지 분야에서 베트남어 소셜 미디어 텍스트에 대한 효과적인 사전 처리 기법의 부족을 해결하기 위해.
  • EDA를 활용한 효과적인 데이터 증강을 통해 베트남어 혐오 발언 데이터셋의 데이터 불균형 문제를 해결하기 위해.
  • 기존 베이스라인 모델들을 능가하는 고성능의 종단 간 혐오 발언 감지 모델을 베트남어에 특화하여 개발하기 위해.
  • 실용적인 소셜 미디어 플랫폼 배포를 위해 Apache Spark를 활용한 실시간 스트리밍 혐오 발언 감지 시스템을 구현하기 위해.
  • 베트남어 디지털 환경에서 더 안전한 온라인 환경을 조성하기 위한 강력하고 확장 가능한 솔루션 기여하기 위해.

제안 방법

  • 베트남어 소셜 미디어 댓글의 품질을 향상시키고 모델 입력 품질을 개선하기 위해 이중 단계 전처리 파이프라인을 제안하였다.
  • 베트남어를 위한 사전 훈련된 다국어 트랜스포머인 PhoBERT와 텍스트-CNN를 조합하여 계층적 특징 추출 및 분류를 수행하였다.
  • 불균형 데이터셋에서 소수 클래스의 성능을 향상시키기 위해 EDA(에러 기반 데이터 증강) 기법을 적용하였다.
  • F1 스코어와 정확도를 평가 지표로 사용하여, 두 가지 벤치마크 데이터셋(ViHSD 및 HSD-VLSP)에서 PhoBERT-CNN 모델을 훈련 및 평가하였다.
  • Apache Spark Structured Streaming 3.1.1을 활용해 실시간 혐오 발언 감지 시스템을 구축하였으며, 평균 1.56초의 응답 시간으로 저지연 처리가 가능하도록 하였다.
  • 실시간 댓글 스트리밍을 위해 YouTube Data API를 사용하였고, 세 명의 경험이 풍부한 베트남어 NLP 전문가가 주석을 부여하였으며, 코HEN의 카파 값은 0.64였다.

실험 결과

연구 질문

  • RQ1최적화된 PhoBERT-CNN 모델이 기존 최신 기술(SOTA) 방법보다 베트남어 혐오 발언 감지에서 뛰어난 성능을 내는가?
  • RQ2향상된 사전 처리 및 EDA 기법이 불균형한 베트남어 혐오 발언 데이터셋에서 모델 성능에 얼마나 기여하는가?
  • RQ3Apache Spark 기반 실시간 스트리밍 시스템이 실시간 소셜 미디어 데이터에서 혐오 및 모욕적 댓글을 효과적으로 분류할 수 있는가?
  • RQ4제안된 시스템은 유튜브에서 실시간으로 유입되는 실제 댓글 데이터에서 어떻게 성능을 내며, 지연 시간과 정확도는 어떠한가?
  • RQ5맥락 인식 사전 처리 기법이 자원이 제한된 베트남어 NLP 환경에서 혐오 발언 감지 모델의 강건성과 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • 제안된 PhoBERT-CNN 모델은 ViHSD 데이터셋에서 F1 스코어 67.46%를 기록하여 기존 베이스라인 모델과 이전 최신 기술(SOTA) 방법들을 능가하였다.
  • HSD-VLSP 데이터셋에서는 높은 수준의 F1 스코어 98.45%를 달성하여 더 균형 잡히고 고품질의 벤치마크에서 강력한 성능을 보였다.
  • 사전 처리 파이프라인은 ViHSD에서 PhoBERT-CNN 모델의 매크로 F1 스코어를 4.80% 향상시키고, HSD-VLSP에서는 9.70% 향상시켜 그 효과를 입증하였다.
  • 베이스라인 모델 역시 사전 처리 기법으로 인해 평균적으로 ViHSD에서 3.58%, HSD-VLSP에서 10.16%의 F1 스코어 향상을 기록하였다.
  • 실시간 스트리밍 시스템은 500개의 실시간 유튜브 댓글에서 매크로 F1 스코어 58.19%와 정확도 82.02%를 기록하였으며, 평균 응답 시간은 1.56초였다.
  • Apache Spark Structured Streaming를 활용한 시스템은 저지연 처리를 구현하여 1ms 연속 처리 성능으로 1초 이내 응답 시간을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.