[논문 리뷰] Fake News Detection Using Majority Voting Technique
이 논문은 공개 데이터셋에서 10,387건의 진짜 뉴스와 10,413건의 가짜 뉴스 기사 자료를 사용하여 다수결 투표 앙상블 모델을 제안한다. 의사결정트리, 로지스틱 회귀, XGBoost, 랜덤 포레스트, 엑스트라 트리, 아다부스트, 서포트 벡터 머신, SGD, 나이브 베이즈 등의 다양한 분류기의 예측을 조합함으로써, 정확도 96.38%, 정밀도 96%, 재현율 96%, F1 스코어 96%를 달성하여 개별 모델을 능가한다.
Due to the evolution of the Web and social network platforms it becomes very easy to disseminate the information. Peoples are creating and sharing more information than ever before, which may be misleading, misinformation or fake information. Fake news detection is a crucial and challenging task due to the unstructured nature of the available information. In the recent years, researchers have provided significant solutions to tackle with the problem of fake news detection, but due to its nature there are still many open issues. In this paper, we have proposed majority voting approach to detect fake news articles. We have used different textual properties of fake and real news. We have used publicly available fake news dataset, comprising of 20,800 news articles among which 10,387 are real and 10,413 are fake news labeled as binary 0 and 1. For the evaluation of our approach, we have used commonly used machine learning classifiers like, Decision Tree, Logistic Regression, XGBoost, Random Forest, Extra Trees, AdaBoost, SVM, SGD and Naive Bayes. Using the aforementioned classifiers, we built a multi-model fake news detection system using Majority Voting technique to achieve the more accurate results. The experimental results show that, our proposed approach achieved accuracy of 96.38%, precision of 96%, recall of 96% and F1-measure of 96%. The evaluation confirms that, Majority Voting technique achieved more acceptable results as compare to individual learning technique.
연구 동기 및 목표
- 소셜 미디어 및 웹 플랫폼에서의 가짜 뉴스 확산 증가 문제를 다루기 위해.
- 앙상블 학습을 통해 다수의 기계 학습 분류기를 조합하여 탐지 정확도를 향상시키기 위해.
- 다수결 투표 기법이 개별 모델을 초월하여 가짜 뉴스 탐지 성능을 향상시키는 데 얼마나 효과적인지 평가하기 위해.
- 공개된 텍스트 특징과 표준 분류기를 사용하여 견고하고 확장 가능한 솔루션을 제공하기 위해.
제안 방법
- 연구는 의사결정트리, 로지스틱 회귀, XGBoost, 랜덤 포레스트, 엑스트라 트리, 아다부스트, 서포트 벡터 머신, SGD, 나이브 베이즈 등 9종의 다양한 기계 학습 분류기를 사용하는 다중 모델 앙상블 접근법을 채택한다.
- 각 분류기는 20,800건의 뉴스 기사에서 추출한 텍스트 특징을 기반으로 훈련되며, 이중 레이블(0: 진짜, 1: 가짜)이 부여된다.
- 모든 9개의 분류기로부터의 예측을 집계하기 위해 다수결 투표 기법을 적용하며, 최종 예측은 가장 많은 표를 얻은 클래스로 결정된다.
- 이 방법은 다양한 모델을 조합함으로써 분산을 줄이고 일반화 능력을 향상시키는 원리를 기반으로 하며, 특히 노이즈가 많고 비정형적인 텍스트 데이터에서 유용하다.
- 평가에서는 동일한 테스트 세트를 대상으로 표준 지표인 정확도, 정밀도, 재현율, F1 측정치를 사용한다.
실험 결과
연구 질문
- RQ1다양한 기계 학습 분류기의 앙상블은 개별 모델 대비 가짜 뉴스 탐지 정확도를 향상시킬 수 있는가?
- RQ2다수결 투표 기법은 가짜 뉴스 탐지에서 다수의 분류기 예측을 집계하는 데 얼마나 효과적인가?
- RQ3실제 가짜 뉴스 데이터셋에서 다수결 투표를 사용해 다수의 분류기를 조합함으로써 얻는 성능 향상은 무엇인가?
- RQ4앙상블 접근법은 가짜 뉴스 탐지에서 높은 정밀도와 재현율을 유지하면서 가짜 양성 및 가짜 음성 결과를 최소화하는가?
주요 결과
- 제안된 다수결 투표 앙상블 모델은 테스트 세트에서 정확도 96.38%를 달성했다.
- 모델은 정밀도 96%를 기록하여 양성 예측에 높은 신뢰도를 보였다.
- 재현율은 96%로, 모든 가짜 뉴스 사례의 96%를 정확히 식별했다는 것을 의미한다.
- F1 측정치는 96%에 도달하여 정밀도와 재현율의 균형 잡힌 조화 평균을 반영했다.
- 앙상블 접근법은 모든 개별 분류기보다 뛰어난 성능을 보이며, 다수결 투표를 통한 모델 평균화의 효과성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.