Skip to main content
QUICK REVIEW

[논문 리뷰] Utilization of Multinomial Naive Bayes Algorithm and Term Frequency Inverse Document Frequency (TF-IDF Vectorizer) in Checking the Credibility of News Tweet in the Philippines

Neil Christian R. Riego, Danny Bell Villarba|arXiv (Cornell University)|2023. 05. 30.
Misinformation and Its Impacts인용 수 4
한 줄 요약

이 연구는 필리핀어 뉴스 트윗에 대한 가짜 뉴스 신뢰도 검출 시스템을 제안한다. 다항 베이지안과 TF-IDF 벡터화를 사용하며, 기준 데이터에 기반한 학습을 통해 미리 보지 않은 데이터에서 88.98%의 정확도를 달성한다. 다만 F1 점수 89.68%는 가짜 뉴스를 진짜로 잘못 분류하는 오류(거짓 양성)를 줄이는데 여전히 개선 여지가 있음을 시사한다.

ABSTRACT

The digitalization of news media become a good indicator of progress and signal to more threats. Media disinformation or fake news is one of these threats, and it is necessary to take any action in fighting disinformation. This paper utilizes ground truth-based annotations and TF-IDF as feature extraction for the news articles which is then used as a training data set for Multinomial Naive Bayes. The model has an accuracy of 99.46% in training and 88.98% in predicting unseen data. Tagging fake news as real news is a concerning point on the prediction that is indicated in the F1 score of 89.68%. This could lead to a negative impact. To prevent this to happen it is suggested to further improve the corpus collection, and use an ensemble machine learning to reinforce the prediction

연구 동기 및 목표

  • 필리핀의 뉴스 트윗에서 가짜 뉴스를 신뢰할 만한 자동화된 시스템을 개발하기 위해.
  • 특히 트위터와 같은 소셜 플랫폼에서 증가하는 디스인포메이션 위협에 대응하기 위해.
  • 바이러스성 뉴스 콘텐츠의 신속한 신뢰도 평가 기능을 통해 미디어 리터러시 향상과 대중 신뢰 회복을 위해.
  • 저자원 다국어 뉴스 신뢰도 검출에 있어 TF-IDF 특징 추출과 다항 베이지안의 융합 효과를 평가하기 위해.

제안 방법

  • 기준 데이터 기반의 뉴스 트윗 주석 처리를 통해 레이블이 부여된 학습 데이터셋을 구축한다.
  • 문장 빈도-역문서 빈도( TF-IDF)를 적용하여 텍스트 콘텐츠를 수치적 특징으로 변환한다.
  • 레이블이 부여된 데이터셋을 사용해 TF-IDF로 인코딩된 특징에 대해 다항 베이지안 분류기를 학습한다.
  • 정확도, 정밀도, 재현율, F1 점수와 같은 표준 NLP 메트릭을 사용해 미리 보지 않은 테스트 데이터에서 모델 성능을 평가한다.
  • 특히 가짜 뉴스를 진짜로 잘못 분류하는 거짓 양성 사례를 중심으로 예측 오류를 분석한다.
  • 코퍼스 향상 및 앙상블 학습 기법을 향후 개선 방안으로 제안하여 오분류를 줄인다.

실험 결과

연구 질문

  • RQ1TF-IDF와 다항 베이지안의 조합이 필리핀 환경에서 뉴스 트윗의 신뢰도를 분류하는 데 얼마나 효과적인가?
  • RQ2모델이 미리 보지 않은 뉴스 트윗을 예측할 때 정확도와 F1 점수는 각각 얼마인가?
  • RQ3왜 모델은 상대적으로 높은 수준의 거짓 양성(가짜 뉴스를 진짜로 잘못 분류)을 보이는가?
  • RQ4기준 데이터 기반 주석 처리 데이터가 저자원 환경에서 신뢰도 검출 모델의 성능을 얼마나 향상시킬 수 있는가?
  • RQ5뉴스 신뢰도 분류에서 거짓 양성 예측을 줄이기 위해 어떤 방법론적 개선이 가능한가?

주요 결과

  • 모델은 학습 데이터에서 99.46%의 정확도를 달성하여 학습 데이터에 대해 강력한 학습 능력을 보였다.
  • 미리 보지 않은 테스트 데이터에서 모델은 88.98%의 정확도를 기록하여 견고한 일반화 성능을 입증했다.
  • F1 점수는 89.68%로 정밀도와 재현율 사이의 중간 수준의 균형을 보였지만, 거짓 양성의 상당한 위험을 시사했다.
  • 높은 거짓 양성 비율은 심각한 사회적 영향을 줄 수 있기 때문에 핵심적인 제약 조건이다. 즉, 가짜 뉴스를 진짜로 잘못 분류할 경우.
  • 이 연구는 거짓 양성을 줄이기 위해 코퍼스 품질 향상과 모델 앙상블 기법이 향후 개선의 핵심 영역임을 규명했다.
  • 결과는 필리핀과 같이 저자원 다국어 환경에서 TF-IDF와 다항 베이지안을 사용한 신뢰도 검출의 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.