[논문 리뷰] HASOCOne@FIRE-HASOC2020: Using BERT and Multilingual BERT models for Hate Speech Detection
이 논문은 영어, 독어, 히브리어에서 혐오 발언 및 공격적 콘텐츠 탐지에 대해 미세 튜닝된 BERT 및 다국어 BERT 모델을 사용하는 것을 제안한다. 이 접근법은 FIRE 2019–2020 공동 과제 데이터셋에서 전이 학습을 활용하여, 영어 혐오 발언 탐지에서 최고 성능을 기록하며 매크로 F1 점수가 최대 88.33%에 이를 정도로 기존의 SVM 및 ELMO 기반 방법들을 크게 능가한다.
Hateful and Toxic content has become a significant concern in today's world due to an exponential rise in social media. The increase in hate speech and harmful content motivated researchers to dedicate substantial efforts to the challenging direction of hateful content identification. In this task, we propose an approach to automatically classify hate speech and offensive content. We have used the datasets obtained from FIRE 2019 and 2020 shared tasks. We perform experiments by taking advantage of transfer learning models. We observed that the pre-trained BERT model and the multilingual-BERT model gave the best results. The code is made publically available at https://github.com/suman101112/hasoc-fire-2020.
연구 동기 및 목표
- 다국어 소셜 미디어 텍스트에서 혐오 발언 및 공격적 콘텐츠를 자동으로 분류하는 시스템을 개발하기 위해.
- 저자원 및 다국어 혐오 발언 탐지 작업에서 BERT 및 다국어 BERT를 사용한 전이 학습의 효과성을 평가하기 위해.
- 기존의 기계 학습 및 신경망 기반 기준 모델(예: TF-IDF를 사용한 SVM 및 ELMO 임베딩)과 BERT 기반 모델을 비교하기 위해.
- 영어, 독어, 히브리어를 포함한 다양한 언어에서 모델 성능 및 실패 케이스를 분석하기 위해.
- 혐오 발언 및 공격적 콘텐츠와 같은 유사하지만 서로 다른 레이블을 공동으로 학습시켜 분류 성능 향상을 도모하기 위한 전략을 탐색하기 위해.
제안 방법
- FIRE 2019 및 2020에서 제공한 레이블이 부여된 데이터셋을 사용하여 사전 훈련된 BERT-base 및 다국어 BERT-base 모델을 혐오 발언 및 공격적 콘텐츠 탐지 작업에 대해 미세 조정하기 위해.
- 최종 BERT 레이어에서 [CLS] 토큰 표현을 문장 수준의 인코딩으로 사용하고, 이에 이어 완전 연결된 소프트맥스 레이어를 적용하여 이진 분류를 수행하기 위해.
- 제한된 레이블이 부여된 데이터를 가진 후행 분류 작업에 대해 대규모 사전 훈련된 언어 표현을 일반적인 언어 표현에서 적응시키기 위해 전이 학습을 활용하기 위해.
- BERT와 대체 방법 간의 비교를 위해 동일한 토크나이제이션 및 전처리 파이프라인을 사용하여 TF-IDF 기반 SVM 및 ELMO 임베딩 + SVM을 사용하기 위해.
- 다양한 언어 간의 OOV(Out-of-Vocabulary) 단어 처리를 향상시키기 위해 SentencePiece 토크나이제이션을 적용하기 위해.
- 영어, 독어, 히브리어의 서브태스크 A 및 B에서 테스트 세트에 대한 매크로 F1 및 정확도를 사용하여 모델 평가하기 위해.
실험 결과
연구 질문
- RQ1BERT 및 다국어 BERT 모델은 다국어 혐오 발언 탐지에서 기존의 기계 학습 및 신경망 기반 기준 모델과 비교하여 어떻게 성능을 내는가?
- RQ2사전 훈련된 트랜스포머 모델을 사용한 전이 학습이 히브리어 및 독어와 같은 저자원 언어에서 분류 성능에 어떤 영향을 미치는가?
- RQ3왜 일부 모델, 예를 들어 다국어 BERT는 비영어 언어에서 혐오 발언 및 공격적 콘텐츠 레이블의 높은 비율을 'NONE'으로 잘못 분류하는가?
- RQ4BERT의 문맥 기반 임베딩이 TF-IDF나 ELMO와 같은 정적 또는 비문맥 기반 임베딩보다 분류 성능 향상에 얼마나 기여하는가?
- RQ5혐오 발언 및 공격적 콘텐츠 탐지의 공동 모델링은 레이블 간의 관계를 활용하여 전체 분류 성능 향상에 얼마나 기여하는가?
주요 결과
- BERT 모델은 영어 서브태스크 A(혐오 발언 탐지)에서 매크로 F1 점수 88.33%와 정확도 88.33%를 기록하여 모든 기준 모델을 능가했다.
- 영어에서 공격적 콘텐츠 식별(서브태스크 B)의 경우, BERT는 매크로 F1 54.44%와 정확도 81.57%를 기록했으며, ELMO + SVM 및 SVM 기준 모델 대비 약 5–7% 향상된 성능을 보였다.
- 독어 서브태스크에서는 다국어 BERT가 중간 수준의 성능을 보였으며, 혐오 발언 탐지에서 매크로 F1 77.91%를 기록했고, 공격적 콘텐츠 식별에서는 47.78%를 기록했다.
- 히브리어 서브태스크에서는 다국어 BERT가 혐오 발언 탐지에서 매크로 F1 63.54%를 기록했고, 공격적 콘텐츠 식별에서는 49.71%를 기록했으며, SVM 및 ELMO + SVM 기준 모델을 모두 능가했다.
- BERT 모델은 히브리어 및 독어에서 많은 혐오 발언 및 공격적 콘텐츠 인스턴스를 잘못 분류했으며, 종종 'NONE' 또는 'PROF'(비속어)로 예측하여 저자원 언어 일반화에 어려움을 겪고 있음을 보여주었다.
- 오류 분석 결과, 모델는 'HATE'와 'OFFN' 레이블을 구분하는 데 가장 어려움을 겪었으며, 특히 비영어 언어에서 이 레이블을 자주 'PROF'로 잘못 분류했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.