Skip to main content
QUICK REVIEW

[논문 리뷰] Jointly embedding the local and global relations of heterogeneous graph for rumor detection

Chunyuan Yuan, Qianwen Ma|arXiv (Cornell University)|2019. 09. 10.
Misinformation and Its Impacts참고 문헌 33인용 수 8
한 줄 요약

이 논문은 소스 트윗과 재트윗에 대한 다중 헤드 어텐션을 통해 국소적 의미 관계를 모델링하고, 사용자, 트윗, 재트윗으로 구성된 이질적 그래프를 통해 전반적 구조적 관계를 동시에 고려하는 새로운 그래프 신경망인 GLAN을 제안한다. GLAN은 최신 기술을 뛰어넘으며, Weibo 데이터셋에서 94%의 정확도를 기록하고, 트위터 데이터셋에서는 4시간 이내에 88–90%의 정확도를 달성하여 뛰어난 초기 탐지 성능을 입증한다.

ABSTRACT

The development of social media has revolutionized the way people communicate, share information and make decisions, but it also provides an ideal platform for publishing and spreading rumors. Existing rumor detection methods focus on finding clues from text content, user profiles, and propagation patterns. However, the local semantic relation and global structural information in the message propagation graph have not been well utilized by previous works. In this paper, we present a novel global-local attention network (GLAN) for rumor detection, which jointly encodes the local semantic and global structural information. We first generate a better integrated representation for each source tweet by fusing the semantic information of related retweets with the attention mechanism. Then, we model the global relationships among all source tweets, retweets, and users as a heterogeneous graph to capture the rich structural information for rumor detection. We conduct experiments on three real-world datasets, and the results demonstrate that GLAN significantly outperforms the state-of-the-art models in both rumor detection and early detection scenarios.

연구 동기 및 목표

  • 소셜 미디어 확산 과정에서 국소적 의미적 맥락과 전반적 구조적 패턴을 동시에 활용하지 못하는 기존 루머 탐지 방법의 한계를 해결하기 위해.
  • 소스 트윗, 재트윗, 사용자 간 잠재적 관계를 통합된 그래프 표현을 통해 캡처하여 초기 루머 탐지 성능을 향상시키기 위해.
  • 텍스트와 네트워크 구조에서 종합적인 표현을 끌어내는 엔드 투 엔드 학습을 통해 수작업으로 만든 특징에 대한 의존도를 줄이기 위해.
  • 재트윗에 대한 어텐션을 통해 국소적 맥락 정보를 모델링하고, 이질적 그래프 어텐션을 통해 전반적 그래프 구조를 동시에 모델링하기 위해.
  • 제한된 확산 데이터로도 실시간 루머 탐지 시나리오에서의 강건성과 성능을 향상시키기 위해.

제안 방법

  • 소스 트윗, 재트윗, 사용자 및 그들의 상호작용(예: 재트윗, 공동 참여 등)을 노드로 하고 관계를 링크로 하는 이질적 그래프를 구축한다.
  • 소스 트윗과 관련된 재트윗의 의미적 특징을 다중 헤드 어텐션을 적용하여 융합하여 풍부한 국소적 표현을 생성한다.
  • 이질적 그래프의 모든 노드 간의 구조적 종속성을 캡처하기 위해 전역 그래프 어텐션 기반 메커니즘을 사용하여 장거리 상관관계를 포착한다.
  • 실제 소셜 미디어 데이터에서 이진 루머 분류를 위한 교차 엔트로피 손실을 사용하여 모델을 엔드 투 엔드로 훈련시킨다.
  • 트윗 텍스트에서 다양한 n-gram 특징을 캡처하기 위해 컨볼루션 레이어에 다중 커널 크기(3, 4, 5)를 통합한다.
  • 특히 트윗 길이와 커널 크기의 영향을 평가하기 위해 제어 변수 방법을 사용한다.

실험 결과

연구 질문

  • RQ1재트윗에서 유도된 국소적 의미 맥락과 이질적 그래프에서 유도된 전반적 구조적 패턴을 동시에 모델링함으로써 루머 탐지 성능을 향상시킬 수 있는가?
  • RQ2재트윗에 대한 다중 헤드 어텐션 통합이 소스 트윗의 국소적 표현 학습에 어떻게 기여하는가?
  • RQ3전체 확산 그래프를 이질적 네트워크로 모델링함으로써 초기 탐지 정확도는 어느 정도 향상되는가?
  • RQ4제한된 확산 시간과 노이즈가 많은 데이터에서 제안된 방법은 얼마나 강건한가?
  • RQ5최대 탐지 성능을 얻기 위해 커널 크기 및 트윗 길이와 같은 하이퍼파rameter의 최적 설정은 무엇인가?

주요 결과

  • GLAN은 Weibo 데이터셋에서 94%의 정확도를 기록하고, Twitter15 및 Twitter16 데이터셋에서는 4시간 이내에 88–90%의 정확도를 달성하여 모든 기준 모델을 압도한다.
  • 시간 지연이 12시간까지 있어도 성능이 유지되어, 시간이 지남에 따라 발생하는 데이터 노이즈와 구조적 복잡성에 강건함을 입증한다.
  • 다양한 커널 크기(3, 4, 5)를 사용할 경우 최고의 성능를 기록하여, 다양한 수신 필드가 더 구분력 있는 어휘를 포착함을 시사한다.
  • 트윗 길이가 일정 수준까지 증가함에 따라 성능이 향상되며, 이는 충분한 텍스트 맥락이 정확한 분류에 필수적임을 확인한다.
  • 4시간 지연 조건에서의 모델 성능이 모든 가용 데이터를 사용한 트리 기반 기준 모델을 뛰어넘어, 뛰어난 초기 탐지 능력을 입증한다.
  • 국소 어텐션과 전역 그래프 어텐션의 통합이 성능 향상에 기여하며, 병렬 모델링의 효과성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.