[논문 리뷰] Why Did They #Unfollow Me? Early Detection of Follower Loss on Twitter
이 논문은 NLP, 네트워크 특징, Doc2vec를 활용한 내용 및 행동 기반 모델을 제안하여 기준 모델 대비 최대 19.67% 높은 정확도로 트위터에서 팔로워 손실을 예측한다. 주요 예측 변수로는 높은 트윗 빈도, 급격한 트윗 발생 패tern, 낮은 주제 다양성, 낮은 언급 참여도를 특정한다.
Having more followers has become a norm in recent social media and micro-blogging communities. This battle has been taking shape from the early days of Twitter. Despite this strong competition for followers, many Twitter users are continuously losing their followers. This work addresses the problem of identifying the reasons behind the drop of followers of users in Twitter. As a first step, we extract various features by analyzing the content of the posts made by the Twitter users who lose followers consistently. We then leverage these features to early detect follower loss. We propose various models and yield an overall accuracy of 73% with high precision and recall. Our model outperforms baseline model by 19.67% (w.r.t accuracy), 33.8% (w.r.t precision) and 14.3% (w.r.t recall).
연구 동기 및 목표
- 트위터에서 팔로워 손실을 이끄는 사회어휘적 및 행동적 요인을 규명하는 것.
- 피해자 사용자의 트윗 내용과 행동만을 기반으로 한 팔로워 손실 조기 예측 모델을 개발하는 것.
- 텍스트 및 심리어휘적 특징을 통합함으로써 네트워크 링크 특징에 의존하는 기준 모델을 능가하는 것.
- 사용자 및 플랫폼이 조기 탐지 기반으로 팔로워 손실을 사전에 완화할 수 있도록 지원하는 것.
제안 방법
- 2014년 6월과 2016년 9월에 크롤링한 930만 명의 트위터 사용자에서 데이터셋을 구축하였으며, ≥30%의 팔로워를 잃은 사용자(데이터셋1)와 ≤2%를 잃은 사용자(데이터셋2)를 선별하였다.
- 공격적 단어 사용, 단어 다양성(엔트로피), 주제 다양성(LDA, K=30), 심리어휘 지표(LIWC 카테고리) 등 텍스트 특징을 추출하였다.
- 두 가지 사용자 네트워크를 구축: 언급 네트워크(방향성 있음, @멘션 기반)와 콘텐츠 유사도 네트워크(Jaccard 기반, 0.3 유사도 기준으로 자르기).
- 두 네트워크에서 중심성 특징(입도수, 출도수, 중심성, 가까움, 고유벡터 중심성, 군집계수)을 계산하였다.
- 트윗 시퀀스에서 Doc2vec를 사용해 사용자에 대한 조밀한 벡터 표현을 생성하고, 수작업 특징과 결합하였다.
- 이중 분류를 위해 교차엔트로피 손실을 사용한 10겹 교차검증을 적용한 다층퍼셉트론(MLP)을 특징 집합에 대해 학습시켰다.
실험 결과
연구 질문
- RQ1트윗 내 언어적 및 행동 패턴 중 트위터 팔로워 손실을 가장 잘 예측하는 것은 무엇인가?
- RQ2언급 패턴과 콘텐츠 유사성과 같은 네트워크 수준의 특징이 팔로워 이탈과 어떻게 관련이 있는가?
- RQ3텍스트, 행동, 네트워크 특징을 통합한 모델이 네트워크 링크 특징만 사용하는 기준 모델을 능가할 수 있는가?
- RQ4특정 특징 중에서 심각한 팔로워 손실를 겪는 사용자와 미미한 변동만 겪는 사용자를 가장 잘 구분하는 것은 무엇인가?
주요 결과
- 제안된 모델은 정확도 73%, 정밀도 73%, 재현율 87%, F1 점수 80%를 기록하여 기준 모델 대비 정확도 19.67% 향상, 정밀도 33.8% 향상, 재현율 14.3% 향상하였다.
- 가장 구분 능력이 높은 여섯 가지 특징은: 평균 트윗 버스트 주기, 최대 트윗 버스트 주기, 트윗 빈도, 언급 엔트로피, 주제 다양성, 언급 네트워크의 고유벡터 중심성이다.
- 팔로워를 잃는 사용자들은 LIWC 분석 결과 부정어 사용 빈도가 높고, 포함적 어휘 사용 빈도가 낮으며, 통찰 어휘 사용 빈도가 감소한 것으로 나타났다.
- 콘텐츠 다양성(단어 엔트로피)과 주제 다양성(LDA 기반)은 강력한 예측 변수였으며, 반복적이거나 주제가 좁은 콘텐츠가 팔로워 손실과 관련이 있음을 시사한다.
- 언급 네트워크의 고유벡터 중심성과 언급 엔트로피는 매우 예측 능력이 높았으며, 이는 참여의 질과 네트워크 내 위치가 팔로워 유지를 위해 중요하다는 것을 시사한다.
- 모델의 ROC-AUC는 0.71로 강력한 구분 능력을 보였으며, 특히 심각한 팔로워 손실이 발생하기 전에 고위험 사용자를 조기에 식별하는 데 유용하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.