[논문 리뷰] BanFakeNews: A Dataset for Detecting Fake News in Bangla
BanFakeNews를 소개하며, 어 ~50K 벵골어 가짜 뉴스 데이터셋과 주석 및 벤치마크를 어휘적, 구문적, 의미적 특징 및 트랜스포머 모델을 사용하여 제공합니다. 인간 베이스라인과 최첨단 NLP 기법에 대한 비교 분석을 제공합니다.
Observing the damages that can be done by the rapid propagation of fake news in various sectors like politics and finance, automatic identification of fake news using linguistic analysis has drawn the attention of the research community. However, such methods are largely being developed for English where low resource languages remain out of the focus. But the risks spawned by fake and manipulative news are not confined by languages. In this work, we propose an annotated dataset of ~50K news that can be used for building automated fake news detection systems for a low resource language like Bangla. Additionally, we provide an analysis of the dataset and develop a benchmark system with state of the art NLP techniques to identify Bangla fake news. To create this system, we explore traditional linguistic features and neural network based methods. We expect this dataset will be a valuable resource for building technologies to prevent the spreading of fake news and contribute in research with low resource languages.
연구 동기 및 목표
- 방글라어 가짜 뉴스 자원 부족 문제를 해결하기 위해 공개적으로 이용 가능한 주석이 달린 데이터셋(~50K 기사)를 출시한다.
- 방글라어 가짜 뉴스 탐지를 다양한 언어 특징과 신경망 구조를 사용하여 벤치마크한다.
- 이 데이터셋에 대한 인간의 성능 베이스라인을 평가하고 정확도에 영향을 주는 요인을 분석한다.
- 벨롱어에 대한 특징 효과(어휘적, 구문적, 의미적, 메타데이터) 및 사전 학습 언어 모델에 대한 통찰을 제공한다.
- 향후 50K 라벨링 예제 확장 및 추가 특징(소스 메타데이터) 포함을 권장한다.
제안 방법
- authentic, fake, 클릭베이트(clickbait), 풍자(satire), 오해 콘텐츠를 포함한 벵골어 가짜 뉴스 데이터셋을 수집하고 헤드라인, 기사, 도메인 및 메타데이터를 포함한다.
- 전통적인 언어 특징을 추출한다: 단어 및 문자 n-그램과 TF-IDF; 품사 태그 빈도; 단어 임베딩(FastText Bangla 및 News 임베딩); 구두점 및 메타데이터(site Alexa 순위, 기사 길이)
- 언어 특징을 바탕으로 전통적 기계 학습 모델(SVM, RF, LR)을 학습시키고 70:30 학습-테스트 분할과 10% 보류 검증을 수행한다.
- 신경망(CNN, 주의(attention) Bi-LSTM) 및 다국어 사전학습 BERT를 텍스트 분류에 적용하고 Adam, 학습률 2e-5, 배치 크기 32로 튜닝하며 Micro-F1 및 가짜 클래스에 대한 클래스별 F1로 평가한다.
- HuggingFace Transformers를 통한 다국어 BERT 모델을 벵골어 데이터세트의 기준선 비교에 사용한다.
실험 결과
연구 질문
- RQ1가짜 뉴스 탐지를 위한 가장 informative한 벵골어 언어 특징은 무엇인가?
- RQ2전통적 어휘/구문/의미 특징이 벵골어 가짜 뉴스에서 신경망 모델보다 우수하게 작용할 수 있는가?
- RQ3사전 학습된 다국어 트랜스포머(BERT)가 선형 분류기와 비교하여 벵골어 가짜 뉴스 탐지에서 어떤 성능을 보이는가?
- RQ4이 데이터세트에 대한 인간 성능 베이스라인은 무엇인가?
- RQ5메타데이터(출처, 헤드라인-본문 관계, 사이트 인기도)가 탐지 성능에 어떤 영향을 미치는가?
주요 결과
- 가짜 클래스의 최고 F1은 모든 언어 특징을 사용할 때 SVM 기반 모델로 0.91에 도달한다.
- 벵골어 가짜 뉴스 탐지에서 어휘 및 문자 n-그램 특징이 일반적으로 다른 특징 세트보다 뛰어난 성능을 보인다.
- 신경망 모델(CNN, Bi-LSTM, BERT)은 베이스라인을 개선하지만 모든 언어 특징을 사용한 최상의 선형 분류기(BERT은 가짜-F1 약 0.68, All Features with SVM은 0.91에 도달)를 능가하지는 못한다.
- 인간 베이스라인은 주석자에 따라 가짜 클래스 F1이 약 0.58–0.70 사이였으며 주석자 간 일치도(Fleiss’ Kappa)는 약 0.389였다.
- 문자 수준 특징은 특히 효과적이며, 향후 신경망 아키텍처에 통합될 가능성이 제시된다.
- 데이터세트에는 예측 가능한 특징으로서 주석 달린 원천 메타데이터, 헤드라인-기사 관계, 사이트 인기도가 포함되어 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.