[논문 리뷰] Hostility Detection and Covid-19 Fake News Detection in Social Media
이 논문은 히ند어(देवनागरी) 및 영어 소셜미디어 콘텐츠에서 적대성과 가짜 뉴스를 탐지하기 위한 앙상블 모델을 제안한다. 히ند어 BERT, FastText, 폭력적 언어 탐지 및 메타데이터 기능을 조합한다. 굵은 단계의 적대성 탐지에서 F1 스코어 0.97을 기록했고, 영어 가짜 뉴스 탐지에서는 0.93을 기록하여 더 큰 BERT 기반 모델을 능가했다. 경량 임베딩과 엔티티 인식 기능을 활용한 덕분이다.
Withtheadventofsocialmedia,therehasbeenanextremely rapid increase in the content shared online. Consequently, the propagation of fake news and hostile messages on social media platforms has also skyrocketed. In this paper, we address the problem of detecting hostile and fake content in the Devanagari (Hindi) script as a multi-class, multi-label problem. Using NLP techniques, we build a model that makes use of an abusive language detector coupled with features extracted via Hindi BERT and Hindi FastText models and metadata. Our model achieves a 0.97 F1 score on coarse grain evaluation on Hostility detection task. Additionally, we built models to identify fake news related to Covid-19 in English tweets. We leverage entity information extracted from the tweets along with textual representations learned from word embeddings and achieve a 0.93 F1 score on the English fake news detection task.
연구 동기 및 목표
- 히ند어와 같은 저자원 언어에서 증가하는 소셜미디어의 적대적이고 가짜 콘텐츠 문제를 해결하기 위해.
- 히브리어(देवनागरी) 및 영어 트윗에서 하이브리드 NLP 기법을 활용해 가짜 뉴스 및 적대성 탐지 정확도를 향상시키기 위해.
- 언어적 특징, 메타데이터, 엔티티 정보가 모델 성능에 미치는 영향을 평가하기 위해.
- 영어 가짜 뉴스 데이터셋에서 잘못 레이블링된 샘플을 식별함으로써 약한 감독 가능성 탐색을 위해.
제안 방법
- 모델은 히브리어 텍스트의 표현 학습을 위해 경량 앙상블인 FastText 및 히브리어 BERT 임베딩을 사용한다.
- 분류 성능 향상을 위해 URL, 멘션, 해시태그, 이모지 수와 같은 메타데이터 기능을 통합한다.
- 공격적 언어 탐지기능을 도입하여 폭력적 및 혐오 발언 탐지 정확도를 향상시킨다.
- 영어 가짜 뉴스 탐지에서는 BoW(단어의 집합) 방식을 통해 Word2Vec 임베딩과 엔티티 정보 및 메타데이터를 통합한다.
- 최종 앙상블 모델은 LSTM 및 완전 연결층을 포함한 여러 기본 모델을 통합하여 일반화 능력을 향상시킨다.
- 각 기능(언어적, 메타데이터, 엔티티 기반)의 기여도를 측정하기 위해 추상화 실험을 실시한다.
실험 결과
연구 질문
- RQ1경량 단어 임베딩에 메타데이터 및 엔티티 기능을 더해 BERT와 같은 더 큰 사전 학습 모델을 능가할 수 있는가?
- RQ2다국어 및 언어별 BERT 모델은 히브리어와 같은 저자원 언어에서 적대성 탐지에 얼마나 효과적인가?
- RQ3메타데이터 및 폭력적 언어 기능은 적대성 탐지 모델의 성능 향상에 얼마나 기여하는가?
- RQ4모델은 영어 가짜 뉴스 데이터셋에서 잘못 레이블링된 샘플을 식별하고 수정할 수 있는가? 이는 향후 약한 감독을 위한 잠재적 가능성이다.
- RQ5다양한 기능 유형(언어적, 메타데이터, 엔티티)이 다중 클래스, 다중 레이블 적대성 탐지에서 상대적으로 기여도는 얼마인가?
주요 결과
- 앙상블 모델은 히브리어에서 굵은 단계의 적대성 탐지에서 가중 F1 스코어 0.97을 기록했으며, 공동 과제에서 45개 팀 중 5위를 기록했다.
- 세밀한 분류에서는 가중 F1 스코어 0.62를 기록했고, 45개 팀 중 7위를 기록했다.
- 메타데이터 기능(URL, 멘션, 해시태그, 이모지 수)의 추가로 세밀한 분류에서 F1 스코어가 최대 7% 향상되었다.
- 영어 가짜 뉴스 태스크에서 더 큰 BERT 기반 모델을 능가했으며, 경량 FastText-LSTM 앙상블을 통해 테스트 데이터에서 F1 스코어 0.95를 기록했다.
- 엔티티 정보 및 메타데이터의 통합은 성능 향상에 상당한 기여를 하였으며, 최고의 모델은 영어 가짜 뉴스 탐지에서 F1 스코어 0.97을 기록했다.
- 모델은 영어 가짜 뉴스 데이터셋에서 몇 가지 잘못 레이블링된 샘플을 정확히 식별하여, 향후 데이터 정제 작업에서 약한 감독의 잠재적 적용 가능성을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.