Skip to main content
QUICK REVIEW

[논문 리뷰] Modeling Information Cascades with Self-exciting Processes via Generalized Epidemic Models

Quyu Kong, Marian-Andrei Rizoiu|arXiv (Cornell University)|2019. 10. 12.
Complex Network Analysis Techniques참고 문헌 26인용 수 5
한 줄 요약

이 논문은 유한한 인구집단 내에서 확률적 SIR 전염병 모델과 자기각성 허크스 과정 간의 일반화된 수학적 연결을 회복 시간 분포를 통해 설정한다. SIR 모델의 회복 시간 분포를 허크스N 과정의 커널 함수와 연결함으로써, 임의의 회복 시간 분포를 允許하는 일반화된 SIR 모델을 제안하고, 회복 위험 함수와 허크스 커널 간의 관계를 유도하며, 시뮬레이션, 피팅, 예측 도구를 개발한다. 주요 기여는 트위터 리트윗 캐스케이드에서 상호보완적인 모델—특히 EXPN 및 PL—을 조합함으로써 인기 예측을 향상시키는 데 있다.

ABSTRACT

Epidemic models and self-exciting processes are two types of models used to describe diffusion phenomena online and offline. These models were originally developed in different scientific communities, and their commonalities are under-explored. This work establishes, for the first time, a general connection between the two model classes via three new mathematical components. The first is a generalized version of stochastic Susceptible-Infected-Recovered (SIR) model with arbitrary recovery time distributions; the second is the relationship between the (latent and arbitrary) recovery time distribution, recovery hazard function, and the infection kernel of self-exciting processes; the third includes methods for simulating, fitting, evaluating and predicting the generalized process. On three large Twitter diffusion datasets, we conduct goodness-of-fit tests and holdout log-likelihood evaluation of self-exciting processes with three infection kernels --- exponential, power-law and Tsallis Q-exponential. We show that the modeling performance of the infection kernels varies with respect to the temporal structures of diffusions, and also with respect to user behavior, such as the likelihood of being bots. We further improve the prediction of popularity by combining two models that are identified as complementary by the goodness-of-fit tests.

연구 동기 및 목표

  • 유한 인구집단 내에서 확률적 SIR 모델과 자기각성 허크스 과정 간의 일반화된 수학적 연결을 수립한다.
  • 표준 조각별 일정한 가정을 초월하여, 임의의 회복 시간 분포를 允許하는 SIR 모델을 확장한다.
  • 일반화된 SIR 및 허크스N 과정을 위한 시뮬레이션, 매개변수 추정, 적합도 검정, 인기 예측 도구를 개발한다.
  • 다양한 시간 역학과 사용자 행동을 보이는 캐스케이드에서, 다양한 감염 커널 함수(지수, 거듭제곱법칙, Tsalis Q-지수)의 성능을 조사한다.
  • 적합도 분석을 통해 상호보완적인 모델로 식별된 모델들을 조합하여 최종 캐스케이드 인기 예측을 향상시킨다.

제안 방법

  • 임의의 회복 시간 분포를 允許하는 일반화된 확률적 SIR 모델을 제안하며, 개인 간 독립적인 회복 시간을 허용한다.
  • SIR 모델의 회복 시간의 보완 누적 분포함수(CCDF)와 허크스N 과정의 커널 함수 간 이론적 연결을 유도하며, CCDF 가 상한선 역할을 함을 보여준다.
  • SIR 회복 위험 함수, 회복 시간 분포, 허크스N 커널 함수 간의 수학적 관계를 수립한다.
  • 감염 및 회복 시간의 쌍체 샘플링을 통한 시뮬레이션 방법을 도입하여 일반화된 SIR 과정의 효율적 생성을 가능하게 한다.
  • 일반 커널을 가진 SIR 및 허크스N 모델에 대한 최대 로그우도 추정 절차를 개발한다.
  • 두 가지 적합도 검정 지표와 절대 상대 오차(ARE)를 사용한 인기 예측 프레임워크를 활용하며, 상호보완적인 모델의 예측 평균을 통한 모델 조합을 시행한다.

실험 결과

연구 질문

  • RQ1임의의 회복 시간 분포를 가진 일반화된 SIR 모델은 어떻게 유한 인구집단 내 허크스 과정(HawkesN)과 공식적으로 연결될 수 있는가?
  • RQ2다양한 시간 역학을 보이는 정보 캐스케이드에서, 허크스N 모델의 다양한 감염 커널 함수(지수, 거듭제곱법칙, Tsallis Q-지수)는 어떻게 성능을 보이는가?
  • RQ3사용자 행동—특히 봇 참여—는 다양한 허크스N 커널 모델의 피팅 및 성능에 어느 정도 영향을 미치는가?
  • RQ4다른 캐스케이드에서 상호보완적인 성능을 보이는 모델들을 조합하면 개별 모델을 초월해 최종 인기 예측 성능을 향상시킬 수 있는가?
  • RQ5실제 데이터에서 관측되지 않은 회복 사건은 SIR 및 허크스N 모델링 프레임워크에서 어떻게 고려될 수 있는가?

주요 결과

  • 일반화된 SIR 모델에서의 회복 시간 CCDF 는 허크스N 과정의 커널 함수에 상한선 역할을 하며, 이는 두 모델 클래스 간 공식적인 수학적 연결을 수립한다.
  • NEWS 트위터 데이터에서, 이벤트 수가 많고 지속 기간이 짧은 캐스케이드에는 지수 커널(EXPN)이 더 잘 맞으며, 이는 봇 참여 증가와 관련이 있다.
  • 모든 세 데이터셋(NEWS, Seismic, ActiveRT)에서, 거듭제곱법칙 커널(PL)이 지수 및 Tsallis Q-지수 커널을 모두 초월하여 최종 인기 예측에서 가장 뛰어난 성능을 보인다.
  • EXPN 및 PL 의 예측을 평균화한 조합 모델은 모든 데이터셋에서 모든 개별 모델을 초월하여 일관되게 뛰어난 인기 예측 성능을 보이며, 절대 상대 오차(ARE)가 가장 낮다.
  • 적합도 검정 결과, 모델 성능은 캐스케이드의 시간적 구조와 사용자 행동에 따라 크게 달라지며, 이는 정보 확산에서 다수의 역학적 메커니즘이 공존함을 시사한다.
  • 10개의 병렬 초기화를 사용해 500개의 이벤트 캐스케이드를 피팅하는 데 평균 4.8분이 소요되며, CPU가 2.2 GHz일 경우 우도 평가 복잡도는 이벤트 수에 대해 2차 함수이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.