[논문 리뷰] Graph-based Modeling of Online Communities for Fake News Detection
SAFER는 사용자와 기사로 구성된 이질적 그래프를 구축하고 관계형 및 쿼터하이퍼볼릭 그래프 신경망을 사용하여 사회적 맥락 특성을 반영해 가짜뉴스 탐지 성능을 향상시키며 두 도메인에서 최첨단 결과를 달성합니다.
Over the past few years, there has been a substantial effort towards automated detection of fake news on social media platforms. Existing research has modeled the structure, style, content, and patterns in dissemination of online posts, as well as the demographic traits of users who interact with them. However, no attention has been directed towards modeling the properties of online communities that interact with the posts. In this work, we propose a novel social context-aware fake news detection framework, SAFER, based on graph neural networks (GNNs). The proposed framework aggregates information with respect to: 1) the nature of the content disseminated, 2) content-sharing behavior of users, and 3) the social network of those users. We furthermore perform a systematic comparison of several GNN models for this task and introduce novel methods based on relational and hyperbolic GNNs, which have not been previously used for user or community modeling within NLP. We empirically demonstrate that our framework yields significant improvements over existing text-based techniques and achieves state-of-the-art results on fake news datasets from two different domains.
연구 동기 및 목표
- 온라인 커뮤니티의 특성을 텍스트 및 간단한 전파 신호를 넘어 가짜뉴스 탐지에 활용하는 동기를 제시한다.
- 기사 내용, 사용자 공유 행동, 소셜 네트워크 구조를 집계하는 그래프 기반 프레임워크 SAFER를 제안한다.
- 다양한 이질적 소셜 그래프를 위한 관계형 및 하이퍼볼릭 변형을 포함한 여러 GNN 아키텍처를 체계적으로 비교한다.
- 텍스트 기반 기준선 및 기존 방법보다 두 도메인에서 향상된 탐지 성능을 보인다.
- 두 데이터셋(GossipCop 및 HealthStory)에서 70/10/20의 학습/검증/테스트 분할로 평가한다.
제안 방법
- 기사 노드와 사용자 노드의 두 유형 노드 이질적 그래프를 구성하고 간선은 사용자가 공유한 기사와 사용자 간 팔로우 관계를 연결한다.
- 텍스트 인코더로 CNN 또는 RoBERTa를 사용하여 기사 텍스트를 인코딩한다.
- 다양한 GNN으로 사용자/소통 그래프를 인코딩한다(GCN, GAT, GraphSAGE, Relational GCN/Relational GAT, Hyperbolic GCN/GAT).
- 인코더를 독립적으로 학습하고 각 기사당 사용자의 임베딩을 정규화된 평균으로 집계하여 사회적 맥락 벡터를 만들고, 텍스트 임베딩과 연결(concatenate)하여 로지스틱 회귀로 분류한다.
- 그래프의 다른 관계 타입을 포착하기 위해 Relational GNN을 사용하고, 스케일-프리, 계층적 구조를 더 잘 임베딩하기 위해 Hyperbolic GNN을 탐색한다.
- 두 데이터셋(GossipCop 및 HealthStory)에서 70/10/20 학습/검증/테스트 분할로 평가하고, 텍스트 기준선, 사회적 기준선 및 기존 방법과 비교한다.
실험 결과
연구 질문
- RQ1온라인 커뮤니티 및 사용자-콘텐츠 공유 관계를 모델링하는 것이 텍스트 기반 접근법을 넘어 가짜뉴스 탐지를 향상시킬 수 있는가?
- RQ2이 작업에서 이질적 소셜 그래프에 대해 Relational 및 Hyperbolic GNN이 전통적 GNN보다 이점을 제공하는가?
- RQ3사회적 맥락 정보가 텍스트 내용과 상호 작용하여 도메인 간 탐지 정확도에 어떤 영향을 미치는가?
- RQ4그래프 밀도와 활성 사용자 선택이 SAFER의 성능에 어떤 영향을 미치는가?
- RQ5자주 활동하는 사용자나 편향된 공유 패턴으로부터의 편향에 SAFER가 견고한가?
주요 결과
- SAFER는 GossipCop 및 HealthStory에서 텍스트 기반 기준선과 다수 공유 기준선보다 유의하게 높은 성능을 보인다.
- Relational GNN 변형은 전통적 GNN보다 우수하며, 이질적 그래프에서 관계를 명시적으로 모델링하는 가치가 입증된다.
- Hyperbolic GNN은 보고된 얕은(2층) 설정에서 전통 GNN과 동등한 성능을 보이지만 더 깊은 그래프에서 잠재적 이점을 보여준다; richer 커뮤니티 모델링은 명확한 클래스 구분을 촉진한다(TSNE 시각화로 확인).
- 그래프 밀도와 활성 사용자 선택에 민감하며, SAFER는 중간 수준의 희소성에서 강하게 유지되고 그래프가 극도로 희소해지면 이득이 감소한다.
- GossipCop에서 사회적 맥락의 이득이 HealthStory보다 더 크게 나타나며, 이는 더 큰 type-(b) 사용자(공유-전용 가짜) 비율과 더 뚜렷한 커뮤니티 구조 때문이다.
- 특정 활성 사용자 상위 약 20K(HealthStory) 및 약 30K(GossipCop)에서 최적 성능이 나타나며, 너무 밀집하거나 너무 희소한 그래프는 성능을 악화시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.