[논문 리뷰] DANES: Deep Neural Network Ensemble Architecture for Social and Textual Context-aware Fake News Detection
DANES는 텍스트 및 소셜 컨텍스트를 융합하는 새로운 딥 뉴럴 네트워크 앙상블 아키텍처를 제안하며, 텍스트 및 소셜 브랜치의 이중 브랜치 프레임워크를 사용하여 통합된 네트워크 임베딩을 생성한다. 도메인 특화 단어 임베딩(예: Mittens)과 소셜 네트워크 특징(예: 사용자 참여도, 팔로워 수)을 결합하여 BuzzFace, Twitter15, Twitter16에서 최신 기술 수준의 정확도를 달성하며, 특히 데이터가 적은 환경에서 기존 모델을 능가한다.
The growing popularity of social media platforms has simplified the creation and distribution of news articles but also creates a conduit for spreading fake news. In consequence, the need arises for effective context-aware fake news detection mechanisms, where the contextual information can be built either from the textual content of posts or from available social data (e.g., information about the users, reactions to posts, or the social network). In this paper, we propose DANES, a Deep Neural Network Ensemble Architecture for Social and Textual Context-aware Fake News Detection. DANES comprises a Text Branch for a textual content-based context and a Social Branch for the social context. These two branches are used to create a novel Network Embedding. Preliminary ablation results on 3 real-world datasets, i.e., BuzzFace, Twitter15, and Twitter16, are promising, with an accuracy that outperforms state-of-the-art solutions when employing both social and textual content features.
연구 동기 및 목표
- 소셜 미디어에서의 가짜 뉴스 유포 문제를 해결하기 위해 탐지 모델에 텍스트 및 소셜 컨텍스트를 통합한다.
- 텍스트 콘텐츠와 사용자 수준의 소셜 상호작용을 결합한 새로운 네트워크 임베딩을 활용하여 탐지 성능을 향상시킨다.
- 제한된 학습 데이터 조건 하에서 모델의 효과성을 평가하여 실제 운영 환경의 제약 조건을 반영한다.
- 데이터 및 컨텍스트 인식형 솔루션을 제공하여 미디어 리터러시를 향상시키고 사용자가 정보에 기반한 결정을 내릴 수 있도록 지원한다.
제안 방법
- 모델은 텍스트 콘텐츠를 인코딩하기 위해 여섯 가지 단어 임베딩(Word2Vec CBOW, Word2Vec Skip-Gram, FastText CBOW, FastText Skip-Gram, GloVe, Mittens)을 사용하는 텍스트 브랜치를 활용한다.
- 소셜 브랜치는 반응 수, 공유 수, 댓글 수, 팔로워 수, 팔로잉 수 등의 사용자 및 게시물 수준의 소셜 특징을 인코딩하여 소셜 네트워크 영향을 캡처한다.
- 텍스트 브랜치와 소셜 브랜치의 출력을 연결하여 새로운 네트워크 임베딩을 생성하며, 이는 가짜 뉴스 분류를 위한 통합된 표현으로서 기능한다.
- 각 임베딩 유형에 최적의 조합을 도출하기 위해 다양한 레이어 구성(예: Bi-LSTM, GRU, 완전 연결 레이어)에 대한 추론 테스트를 수행한다.
- 정확도를 주요 지표로 사용하여 세 가지 실제 데이터셋(BuzzFace, Twitter15, Twitter16)에서 모델을 학습하고 평가한다.
- 계산 비용을 고려해 소셜 특징에 대해 비용이 많이 드는 사전 학습된 트랜스포머를 회피하고, 가벼운 플랫폼 전용 소셜 메타데이터에 집중한다.
실험 결과
연구 질문
- RQ1RQ1: 텍스트 및 소셜 컨텍스트를 통합한 솔루션은 가짜 뉴스 탐지 성능을 향상시키는가?
- RQ2RQ2: 이러한 솔루션은 제한된 학습 데이터에서 잘 작동하는가?
- RQ3RQ3: 어떤 단어 임베딩 조합과 신경망 레이어 조합이 최고의 네트워크 임베딩을 생성하는가?
- RQ4RQ4: 소셜 및 텍스트 컨텍스트를 통합한 하이브리드 모델은 최신 기술 수준의 가짜 뉴스 탐지 시스템을 능가하는가?
주요 결과
- 텍스트 코퍼스가 중간에서 대규모일 경우, Mittens 임베딩과 소셜 컨텍스트 특징을 통합한 네트워크 임베딩이 가장 높은 정확도를 기록한다.
- 소규모에서 중간 규모의 데이터셋에서는 FastText 임베딩이 다른 단어 임베딩보다 뛰어나며, 특히 서브워드 정보가 중요한 경우에 유리하다.
- 사용자 참여도 및 팔로워 수와 같은 소셜 컨텍스트 특징의 통합은 탐지 성능을 크게 향상시켜 소셜 컨텍스트의 가치를 확인한다.
- 모델은 BuzzFace, Twitter15, Twitter16에서 최신 기술 수준의 정확도를 달성하며, 특히 데이터가 적은 환경에서 기존 최신 기술 수준 모델을 능가한다.
- 추론 연구 결과, 텍스트 및 소셜 임베딩을 모두 통합할 경우 단일 모odal을 사용하는 것보다 더 우수한 성능을 내며, 이는 이중 브랜치 아키텍처의 타당성을 입증한다.
- Bi-LSTM, GRU 또는 완전 연결 레이어 중 선택이 성능에 상당한 영향을 미치며, 최적의 구성은 데이터셋 및 임베딩 유형에 따라 달라진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.