[논문 리뷰] VAIS Hate Speech Detection System: A Deep Learning based Approach for System Combination
이 논문은 베트남어 소셜미디어에서 혐오 발언을 탐지하기 위한 딥러닝 기반 앙상블 시스템 VAIS를 제안한다. 다양한 텍스트 표현 방식(CBOW, fastText, sonvx, RoBERTa)과 모델(TextCNN, LSTM-CNN, VDCNN, SARNN)을 스태킹 앙상블 방식으로 융합하여 분류 성능을 향상시켰다. 이 시스템은 VLSP 2019에서 공개 리더보드에서 0.730 F1 매크로 스코어를 기록했고, 비공개 리더보드에서는 0.584를 기록했다.
Nowadays, Social network sites (SNSs) such as Facebook, Twitter are common places where people show their opinions, sentiments and share information with others. However, some people use SNSs to post abuse and harassment threats in order to prevent other SNSs users from expressing themselves as well as seeking different opinions. To deal with this problem, SNSs have to use a lot of resources including people to clean the aforementioned content. In this paper, we propose a supervised learning model based on the ensemble method to solve the problem of detecting hate content on SNSs in order to make conversations on SNSs more effective. Our proposed model got the first place for public dashboard with 0.730 F1 macro-score and the third place with 0.584 F1 macro-score for private dashboard at the sixth international workshop on Vietnamese Language and Speech Processing 2019.
연구 동기 및 목표
- 베트남어 소셜미디어 플랫폼에서 혐오 발언 및 공격적 콘텐츠를 탐지하는 데 도전하는 것.
- 베트남어 텍스트에서 다중 클래스 혐오 발언 탐지 작업(hate, offensive, clean)의 분류 성능을 향상시키는 것.
- 베트남어 소셜미디어 텍스트의 데이터 불균형 및 언어적 다양성(예: 청소년 어휘, 철자 실수, 이모티콘)을 해결하는 것.
- 다양한 텍스트 표현 방식과 딥러닝 아키텍처를 융합하여 일반화 능력이 향상된 견고한 앙상블 기반 모델을 개발하는 것.
- 베트남어 혐오 발언 탐지 분야에서 VLSP 2019 공동 과제에서 최신 기술 성능을 달성하는 것.
제안 방법
- 공백, BPE, 형태소 토크나이제이션을 포함한 다중 토크나이제이션 전략을 적용하여 원시 베트남어 텍스트를 표준화하고, 음절 표기법을 정규화하는 전처리를 수행한다.
- 다양한 임베딩 크기와 학습 전략을 사용하여 CBOW, fastText, sonvx, RoBERTa 임베딩을 활용해 다수의 텍스트 표현 방식을 생성한다.
- 통합 표현 방식을 기반으로 TextCNN, LSTM-CNN, VDCNN, SARNN 등의 딥러닝 모델을 훈련시켜 다양한 예측 결과를 도출한다.
- 스태킹 앙상블 방법을 적용하여 기본 모델의 확률 출력 결과를 메타-러닝 모델(128개 유닛을 가진 은닉층 1개를 가진 밀집 신경망)의 입력 특성으로 사용한다.
- 데이터 불균형을 완화하기 위해 클래스 가중치 손실 함수를 적용하며, 각 클래스에 대한 가중치는 clean: 0.09, offensive: 0.95, hate: 0.96로 설정한다.
- 90/10 훈련/검증 세트를 기반으로 모델을 최적화하고, 앙상블 스태킹 전에 F1 매크로 스코어 기준으로 가장 우수한 성능을 보인 모델을 선별한다.
실험 결과
연구 질문
- RQ1다양한 딥러닝 모델과 텍스트 표현 방식을 융합한 앙상블이 베트남어 소셜미디어에서 다중 클래스 혐오 발언 탐지에 얼마나 효과적인가?
- RQ2사전 학습 및 자기 학습된 단어 및 문장 임베딩은 자원이 제한된 베트남어 텍스트에서 분류 성능 향상에 어느 정도 기여하는가?
- RQ3데이터 불균형은 모델 성능에 어떤 영향을 미치며, 클래스 가중치는 다수 클래스(정상)에 대한 과적합을 완화할 수 있는가?
- RQ4공개 리더보드 결과는 우수했지만 비공개 리더보드에서 성능이 급격히 떨어지는 이유는 무엇인가?
- RQ5특정 단어(예: 'vl')와 같은 언어 패턴이 체계적인 오분류를 유발하는 이유는 무엇이며, 이를 어떻게 완화할 수 있는가?
주요 결과
- VAIS 시스템은 VLSP 2019 공동 과제에서 공개 리더보드에서 0.73019 F1 매크로 스코어, 비공개 리더보드에서는 0.58455를 기록했다.
- 모델은 공개 검증 세트에서 우수한 성능(F1 매크로 0.7356)을 보였지만, 공개 테스트 세트에 대해 심각한 과적합을 보여 비공개 세트에서 급격한 성능 저하가 발생했다.
- 오분류된 인스턴스 중 약 62%가 공격적 클래스, 48%가 혐오 클래스에서 기인했으며, 이는 주로 정상 클래스에서 빈도가 매우 높은 단어 'vl'에 대한 과적합 때문이었다.
- 시스템의 성능는 데이터 불균형의 영향을 크게 받았으며, 클래스 가중치(0.09, 0.95, 0.96)가 모델이 항상 '정상'으로 예측하는 것을 방지하는 데 필수적이었다.
- 앙상블 접근 방식은 모델의 견고성을 향상시켰지만, 인간 레이블러가 분류한 공격적 및 혐오 발언 사이의 구분을 여전히 어려워했다.
- 스태킹 앙상블 방법은 다양한 모델의 예측 결과를 효과적으로 융합했지만, 최종 성능는 과적합과 훈련 데이터 내 언어적 특수성으로 인해 제한을 받았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.