[논문 리뷰] Fake News Detection using Semi-Supervised Graph Convolutional Network
이 논문은 제한된 레이블 데이터를 사용하여 가짜 뉴스 탐지에 적합한 준지도 학습 그래프 컨volution 네트워크(GCN)-기반 프레임워크를 제안한다. GloVe 임베딩과 워드 무버스 거리(Word Movers' Distance)를 활용해 텍스트 유사도 그래프를 구축하고, GCN를 적용하여 이진 분류를 수행하며, Real or Fake 데이터셋에서 95.27%의 정확도를 기록하여 기존 방법들을 능가한다.
Social media becomes the central way for people to obtain and utilise news, due to its rapidness and inexpensive value of data distribution. Though, such features of social media platforms also present it a root cause of fake news distribution, causing adverse consequences on both people and culture. Hence, detecting fake news has become a significant research interest for bringing feasible real time solutions to the problem. Most current techniques of fake news disclosure are supervised, that need large cost in terms of time and effort to make a certainly interpreted dataset. The proposed framework concentrates on the text-based detection of fake news items while considering that only limited number of labels are available. Graphs are functioned extensively under several purposes of real-world problems on the strength of their property to structure things easily. Deep neural networks are used to generate great results within tasks that utilizes graph classification. The Graph Convolution Network works as a deep learning paradigm which works on graphs. Our proposed framework deals with limited amount of labelled data; we go for a semi-supervised learning method. We come up with a semi-supervised fake news detection technique based on GCN (Graph Convolutional Networks). The recommended architecture comprises of three basic components: collecting word embeddings from the news articles in datasets utilising GloVe, building similarity graph using Word Movers Distance (WMD) and finally applying Graph Convolution Network (GCN) for binary classification of news articles in semi-supervised paradigm. The implemented technique is validated on three different datasets by varying the volume of labelled data achieving 95.27 % highest accuracy on Real or Fake dataset. Comparison with other contemporary techniques also reinforced the supremacy of the proposed framework.
연구 동기 및 목표
- 소셜 미디어 플랫폼에서의 가짜 뉴스 확산 문제를 해결하기 위해.
- 가짜 뉴스 탐지에 있어 대규모 수동 레이블링 데이터셋에 의존도를 줄이기 위해.
- 제한된 레이블 데이터를 효과적으로 활용하는 준지도 학습 프레임워크를 개발하기 위해.
- 텍스트 유사도 기반 표현 학습을 통해 탐지 성능을 향상시키기 위해.
- 다양한 레이블 부족 조건에서 여러 벤치마크 데이터셋을 대상으로 제안된 방법을 검증하기 위해.
제안 방법
- 뉴스 기사에서 GloVe 사전 학습 모델을 사용해 단어 임베딩을 추출한다.
- 뉴스 기사 간 의미적 유사도를 측정하기 위해 워드 무버스 거리(Word Movers' Distance, WMD)를 사용해 텍스트 유사도 그래프를 구축한다.
- 유사도 그래프에 그래프 컨볼루션 네트워크(GCN)를 적용하여 종단 간 준지도 분류를 수행한다.
- 소량의 레이블 샘플만을 사용하여 GCN 모델이 뉴스 기사를 실재 또는 가짜로 이진 분류한다.
- 레이블된 데이터와 레이블이 없는 데이터를 모두 활용해 프레임워크를 종단 간 준지도 방식으로 훈련한다.
- 다양한 레이블 비율 조건에서 세 가지 벤치마크 데이터셋을 대상으로 모델 성능을 평가한다.
실험 결과
연구 질문
- RQ1제한된 레이블 데이터로 준지도 GCN 기반 접근법이 높은 가짜 뉴스 탐지 정확도를 달성할 수 있는가?
- RQ2WMD 기반 그래프 구축 방식이 뉴스 기사 간 의미 관계를 얼마나 효과적으로 포착하는가?
- RQ3레이블 부족 조건에서 제안된 GCN 프레임워크가 기존의 지도 및 준지도 학습 방법보다 뛰어난 성능을 보이는가?
- RQ4모델은 다양한 실제 세계의 가짜 뉴스 데이터셋에 대해 얼마나 강건한가?
- RQ5레이블 비율의 변화가 모델의 일반화 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 방법은 레이블 부족 조건에서 Real or Fake 데이터셋에서 최고 95.27%의 정확도를 기록했다.
- 모든 평가된 데이터셋에서 탐지 정확도 측면에서 다른 최신 기법들을 능가했다.
- 레이블 데이터가 제한된 조건에서 준지도 학습 파라다임이 완전히 지도 학습 기반 모델에 비해 성능을 크게 향상시켰다.
- 그래프 구축에 WMD를 사용함으로써 의미 표현이 향상되어 유사한 뉴스 기사들이 더 잘 군집화되었다.
- 다양한 데이터셋에 걸쳐 강력한 일반화 성능을 보이며 프레임워크의 강건성을 확인했다.
- 제거 실험을 통해 GloVe, WMD, GCN 각 구성 요소가 최종 성능에 의미 있는 기여를 했다고 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.