Skip to main content
QUICK REVIEW

[논문 리뷰] VigDet: Knowledge Informed Neural Temporal Point Process for Coordination Detection on Social Media

Yizhou Zhang, Karishma Sharma|arXiv (Cornell University)|2021. 10. 28.
Domain Adaptation and Few-Shot Learning인용 수 10
한 줄 요약

VigDet는 변분 추론을 통해 계정 임베딩과 그룹 할당을 동시에 학습하는 지식 기반 신경 시계점과정 모델을 제안한다. 이는 조율된 소셜미디어 계정을 탐지하기 위해 설계되었다. 시간적 논리와 필터 함수를 통해 사전 지식을 통합함으로써, 비지도 및 준지도 설정에서 최신 기술을 능가하며 실제 코로나19 백신 트윗 데이터에서 반백신 협동 행위를 탐지한다.

ABSTRACT

Recent years have witnessed an increasing use of coordinated accounts on social media, operated by misinformation campaigns to influence public opinion and manipulate social outcomes. Consequently, there is an urgent need to develop an effective methodology for coordinated group detection to combat the misinformation on social media. However, existing works suffer from various drawbacks, such as, either limited performance due to extreme reliance on predefined signatures of coordination, or instead an inability to address the natural sparsity of account activities on social media with useful prior domain knowledge. Therefore, in this paper, we propose a coordination detection framework incorporating neural temporal point process with prior knowledge such as temporal logic or pre-defined filtering functions. Specifically, when modeling the observed data from social media with neural temporal point process, we jointly learn a Gibbs-like distribution of group assignment based on how consistent an assignment is to (1) the account embedding space and (2) the prior knowledge. To address the challenge that the distribution is hard to be efficiently computed and sampled from, we design a theoretically guaranteed variational inference approach to learn a mean-field approximation for it. Experimental results on a real-world dataset show the effectiveness of our proposed method compared to the SOTA model in both unsupervised and semi-supervised settings. We further apply our model on a COVID-19 Vaccine Tweets dataset. The detection result suggests the presence of suspicious coordinated efforts on spreading misinformation about COVID-19 vaccines.

연구 동기 및 목표

  • 희소한 사용자 활동과 제한된 표현 학습 성능에도 불구하고 조율된 소셜미디어 계정을 탐지하는 데 도전하는 것.
  • 시간적 동기화와 동시 발생 패턴과 같은 사전 지식을 딥러닝 프레임워크에 통합하여 조율 탐지 성능을 향상시키는 것.
  • 학습된 표현과 사전 지식 양쪽 모두와의 일관성을 균형 잡는 겹치는 분포를 사용하여 계정 임베딩과 그룹 할당을 동시에 학습하는 것.
  • 기하학적 평균 근사법을 통해 계산이 불가능한 그룹 할당 분포를 근사하는 이론적으로 탄탄한 변분 추론 방법을 개발하는 것.
  • 실제 데이터셋, 즉 IRA 데이터셋과 코로나19 백신 트윗 데이터셋을 대상으로 모델을 평가하여 조율된 오인정보 캠페인을 탐지하는 것.

제안 방법

  • 모델은 소셜미디어 이벤트 시퀀스로부터 동적 계정 임베딩을 학습하기 위해 신경 시계점과정을 사용한다.
  • 사전 지식은 시간적 논리와 거듭제곱 함수를 사용하여 조율 행동의 그래프로 표현되며, 동시 발생 및 시간적 동기화와 같은 사례를 포함한다.
  • 그룹 할당에 대한 겹치는 분포가 정의되며, 임베딩 공간과 사전 지식 그래프 양쪽과의 일관성을 측정하는 잠재 점수를 포함한다.
  • 겹치는 분포의 계산이 불가능한 분할 함수를 처리하기 위해 기하학적 평균 근사법을 사용하는 변분 추론 프레임워크가 도입된다.
  • 기하학적 평균 근사법을 통해 기대하도(ELBO)를 최대화함으로써 변분 근사와 모델 파라미터를 동시에 최적화하기 위해 EM 알고리즘을 사용한다.
  • 모델은 엔드 투 엔드로 훈련되어 이론적 보장을 갖춘 동시에 표현 학습과 그룹 탐지 기능을 동시에 수행한다.

실험 결과

연구 질문

  • RQ1사용자 활동이 희소한 상황에서 신경 시계점과정 모델이 조율된 소셜미디어 계정을 효과적으로 탐지할 수 있는가?
  • RQ2집단적 행동에 대한 사전 지식(예: 동시 발생, 동기화)을 딥러닝 프레임워크에 효과적으로 통합할 수 있는가?
  • RQ3기하학적 평균 근사법을 사용하는 변분 추론 접근법이 계산이 불가능한 그룹 할당 분포에 대해 처리 가능하고 이론적으로 타당한 해결책을 제공할 수 있는가?
  • RQ4사전 지식 통합이 데이터 전용 딥러닝 베이스라인에 비해 탐지 성능을 향상시키는가?
  • RQ5지표가 없는 실세계 데이터셋, 예를 들어 반백신 트윗 캠페인에서 모델이 의심스러운 조율 행동을 탐지할 수 있는가?

주요 결과

  • IRA 데이터셋에서 VigDet는 비지도 및 준지도 조율 탐지 설정 모두에서 최신 기술 모델을 능가한다.
  • 모델은 코로나19 백신 트윗 데이터셋에서 55.4%의 신뢰할 수 없는 또는 음모론 뉴스 출처를 공유한 조율된 그룹을 탐지했으며, 이는 정상 계정 그룹의 23.2%보다 뚜렷이 높은 비율이다.
  • 탐지된 조율 그룹은 정상 계정보다 최근에 생성된 계정 비율이 높았는데, 20.4% 대비 15.3%로, 최근 악성 활동이 있었음을 시사한다.
  • 탐지된 그룹의 대표 트윗 분석 결과, 반백신 메시지, 음모론, 백신 효과성 및 안전성에 대한 오해를 널리 퍼뜨리는 내용이 확인되었다.
  • 모델 성능은 추론 실험을 통해 검증되었으며, 신경 포인트 과정과 사전 지식 통합 구성 요소의 기여도가 확인되었다.
  • 강력한 성능에도 불구하고, 정상 계정을 잘못 레이블링하거나 진짜 조율 그룹을 놓칠 수 있으므로, 인간 검증의 보조 도구로 사용되어야 하며 절대적인 증거로는 사용해서는 안 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.