Skip to main content
QUICK REVIEW

[논문 리뷰] The 2021 Urdu Fake News Detection Task using Supervised Machine Learning and Feature Combinations

Muhammad Humayoun|arXiv (Cornell University)|2022. 04. 06.
Misinformation and Its Impacts인용 수 5
한 줄 요약

이 논문은 하이브리드 n-그램 특징(단어 및 문자 n-그램)과 언어학적 전처리를 사용한 지도 학습 기반의 우르두어 가짜 뉴스 탐지 방법을 제시한다. 최고의 성능을 보인 모델은 정규화된 정규화 및 특징 선택을 수행한 다항식 커널 SVM로, F1 매크로 스코어 0.6674를 기록하여 모든 경쟁 참가자들을 압도하고 2021년 기준으로 우르두어 가짜 뉴스 탐지 분야에서 새로운 최고의 성능(SOTA)을 수립하였다.

ABSTRACT

This paper presents the system description submitted at the FIRE Shared Task: "The 2021 Fake News Detection in the Urdu Language". This challenge aims at automatically identifying Fake news written in Urdu. Our submitted results ranked fifth in the competition. However, after the result declaration of the competition, we managed to attain even better results than the submitted results. The best F1 Macro score achieved by one of our models is 0.6674, higher than the second-best score in the competition. The result is achieved on Support Vector Machines (polynomial kernel degree 1) with stopwords removed, lemmatization applied, and selecting the 20K best features out of 1.557 million features in total (which were produced by Word n-grams n=1,2,3,4 and Char n-grams n=2,3,4,5,6). The code is made available for reproducibility.

연구 동기 및 목표

  • 우르두어와 같은 저자원 언어에서 가짜 뉴스를 효과적으로 탐지하기 위한 지도 학습 기반 시스템을 개발하는 것.
  • 정규어 제거 및 어간 추출과 같은 다양한 언어학적 전처리 기법이 가짜 뉴스 탐지 성능에 미치는 영향을 평가하는 것.
  • 정확도를 극대화하기 위해 단어 및 문자 n-그램 특징의 최적 조합을 규명하는 것.
  • FIRE 2021 공동 과제에서 우르두어 가짜 뉴스 탐지 분야에서 최고의 성능을 달성하는 것.
  • 향후 연구를 위해 재현 가능한 시스템을 제공하기 위해 코드를 공개하는 것.

제안 방법

  • 시스템은 우르두어 뉴스 기사의 텍스트 특징을 추출하기 위해 단어 n-그램(n=1에서 4까지)과 문자 n-그램(n=2에서 6까지)의 조합을 활용한다.
  • 텍스트 전처리에는 어휘적 다양성을 줄이고 특징 품질을 향상시키기 위해 정규어 제거 및 어간 추출이 포함된다.
  • 후보 특징 총 155만 개 중에서 가장 정보량이 많은 상위 20,000개 특징을 선택하기 위해 탐욕적 접근을 사용하여 특징 선택을 수행한다.
  • 주요 분류기로 다항식 커널(차수 1)을 사용한 서포트 벡터 머신(SVM)을 사용한다.
  • 표준 평가 지표, 특히 F1 매크로 스코어를 사용하여 FIRE 2021 공동 과제 데이터셋에서 성능을 평가하고 모델을 훈련시킨다.
  • 최종 모델 구성은 다양한 특징 및 전처리 조합에 대한 교차 검증 및 성능 비교를 바탕으로 선정된다.

실험 결과

연구 질문

  • RQ1우르두어에서 가짜 뉴스 탐지에 가장 적합한 단어 및 문자 n-그램 특징의 조합은 무엇인가?
  • RQ2정규어 제거 및 어간 추출과 같은 전처리 기법은 우르두어 가짜 뉴스 탐지 모델의 성능에 어떤 영향을 미치는가?
  • RQ3저자원 언어인 우르두어 가짜 뉴스 탐지 맥락에서 다항식 커널 SVM이 다른 분류기보다 뛰어난 성능을 낼 수 있는가?
  • RQ4지도 학습과 특징 공학을 활용할 때, FIRE 2021 우르두어 가짜 뉴스 탐지 벤치마크에서 달성 가능한 성능의 상한선은 무엇인가?
  • RQ5최종 모델은 F1 매크로 스코어 측면에서 공동 과제의 다른 제출물들과 비교해 어떤가?

주요 결과

  • 최고 성능을 보인 모델은 F1 매크로 스코어 0.6674를 기록하여 경쟁에서 두 번째로 높은 스코어를 기록한 참가자들을 뛰어넘었다.
  • 어간 추출 및 정규어 제거를 적용한 다항식 커널 SVM(차수 1)이 테스트된 모든 구성 중에서 가장 높은 성능을 기록하였다.
  • 총 155만 개의 특징에서 상위 20,000개의 특징으로의 특징 선택이 모델의 효율성과 성능 향상에 크게 기여하였다.
  • 단어 n-그램(n=1에서 4까지)과 문자 n-그램(n=2에서 6까지)을 모두 포함하는 것이 우르두어 텍스트의 의미적 및 형태학적 패턴을 포괄적으로 포착하는 데 핵심적이었다.
  • 최종 모델은 FIRE 2021 공동 과제의 모든 제출 사례를 압도하여, 우르두어 가짜 뉴스 탐지 분야에서 새로운 최고의 성능(SOTA)을 확립하였다.
  • 시스템의 코드는 향후 저자원 NLP 분야의 연구를 지원하기 위해 공개되어 재현 가능성을 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.