Skip to main content
QUICK REVIEW

[논문 리뷰] Identification of Twitter Bots Based on an Explainable Machine Learning Framework: The US 2020 Elections Case Study

Alexander Shevtsov, Christos Tzagkarakis|arXiv (Cornell University)|2021. 12. 08.
Spam and Phishing Detection인용 수 5
한 줄 요약

이 논문은 2020년 미국 선거 기간 동안 XGBoost를 사용하고 SHAP 기반의 해석 가능성 기법을 적용하여 트위터 봇을 탐지하기 위한 설명 가능한 기계학습 프레임워크를 제안한다. 프로필, 시간적, 네트워크 기반 특징을 활용함으로써 높은 탐지 정확도를 달성하였으며, SHAP 분석을 통해 봇 계정은 낮은 리스트 멤버십, 낮은 좋아요 활동, 높은 급속 팔로잉 행동을 보임을 확인하였다.

ABSTRACT

Twitter is one of the most popular social networks attracting millions of users, while a considerable proportion of online discourse is captured. It provides a simple usage framework with short messages and an efficient application programming interface (API) enabling the research community to study and analyze several aspects of this social network. However, the Twitter usage simplicity can lead to malicious handling by various bots. The malicious handling phenomenon expands in online discourse, especially during the electoral periods, where except the legitimate bots used for dissemination and communication purposes, the goal is to manipulate the public opinion and the electorate towards a certain direction, specific ideology, or political party. This paper focuses on the design of a novel system for identifying Twitter bots based on labeled Twitter data. To this end, a supervised machine learning (ML) framework is adopted using an Extreme Gradient Boosting (XGBoost) algorithm, where the hyper-parameters are tuned via cross-validation. Our study also deploys Shapley Additive Explanations (SHAP) for explaining the ML model predictions by calculating feature importance, using the game theoretic-based Shapley values. Experimental evaluation on distinct Twitter datasets demonstrate the superiority of our approach, in terms of bot detection accuracy, when compared against a recent state-of-the-art Twitter bot detection method.

연구 동기 및 목표

  • 고위험 선거 기간, 특히 2020년 미국 선거 기간 동안 트위터 봇을 식별하기 위한 지도 학습 기반 기계학습 프레임워크를 개발하는 것.
  • 트위터 API에서 추출한 특징 중에서 봇 탐지 작업에서 가장 높은 성능을 내는 특징 조합을 규명하는 것.
  • 주요 학습 데이터셋 외에도 여러 잘 알려진 트위터 데이터셋에 대해 모델의 일반화 능력을 평가하는 것.
  • 블랙박스 모델을 넘어서 SHAP 값을 활용한 예측의 해석 가능성 제공을 통해 봇 분류 결정의 근거를 드러내는 것.
  • 특징 기여도 분 析를 통해 봇 행동 패턴에 대한 실질적인 통찰을 제공함으로써 향후 봇 탐지 및 완화 전략 수립을 지원하는 것.

제안 방법

  • 연구는 XGBoost 알고리즘을 사용한 지도 학습 기반 기계학습 파이프라인을 활용하며, 하이퍼파라미터 튜닝을 위해 k-폴드 교차검증을 적용한다.
  • 프로필 메타데이터, 시간적 활동 패턴, 멘션, 친구, 리스트 멤버십 등의 네트워크 상호작용 지표를 포함한 트위터 API 데이터에서 특징을 추출한다.
  • 레이블 신뢰도를 향상시키기 위해 두 가지 잘 알려진 온라인 봇 탐지 도구의 예측 결과를 집계하여 진정성 있는 레이블을 생성한다.
  • 모델 평가의 신뢰성을 확보하기 위해 훈련/검증/테스트 세트로 분할을 적용하며, 클래스 불균형 문제를 해결하기 위해 SMOTE를 사용해 오버샘플링을 수행한다.
  • SHAP(샤플리 추가 설명)를 활용하여 특징 기여도를 계산하고 모델 예측을 해석하며, 게임 이론적 샤플리 값으로 각 특징이 개별 예측에 기여하는 정도를 정량화한다.
  • 정확도, 정밀도, 재현율, F1 점수와 같은 표준 평가 지표를 사용하여 모델 성능을 평가하며, 최근 최고 수준의 방법(Yang et al., 2020)과의 비교도 수행한다.

실험 결과

연구 질문

  • RQ12020년 미국 선거 트위터 데이터셋을 기반으로 지도 학습 기반 모델을 효과적으로 학습 및 최적화하여 높은 봇 탐지 정확도를 달성할 수 있는가?
  • RQ2프로필, 시간적, 상호작용, 네트워크 기반 특징 중에서 어떤 조합이 봇 탐지 성능을 가장 높게 이끌는가?
  • RQ3제안된 모델은 주 학습 데이터셋 외에도 다양한 잘 알려진 트위터 데이터셋에 대해 잘 일반화되는가?
  • RQ4모델의 의사결정 과정은 어느 정도 해석 가능하고, 특히 특징 기여도 분석을 통해 설명 가능한가?
  • RQ5SHAP와 같은 설명 가능한 인공지능 기법을 통해 봇 계정과 정상 사용자를 구분하는 행동 패턴은 무엇인가?

주요 결과

  • XGBoost 모델은 최근 최고 수준의 방법(Yang et al., 2020)보다 뛰어난 봇 탐지 정확도를 보이며, 2020년 미국 선거 데이터셋에서 뛰어난 성능을 입증하였다.
  • 모델 예측에 가장 큰 영향을 미친 특징은 'listed_count'였으며, 이는 봇 계정이 정상 사용자보다 훨씬 적은 확률로 트위터 리스트 멤버십을 가지는 것으로 나타났다.
  • 봇 사용자는 'favourites_by_age'(나이 대비 좋아요 수)가 낮게 나타나, 다른 사용자의 트윗에 대해 좋아요를 하거나 참여하는 경향이 적음을 시사한다.
  • 봇 계정은 'friends_by_age'(나이 대비 친구 수) 값이 높게 나타나, 짧은 시간 내에 빠르고 공격적인 팔로잉 행동을 통해 네트워크의 가시성을 확장함을 보여준다.
  • SHAP 요약 플롯을 통해 상위 20개 영향력 있는 특징은 주로 통계적, 시간 기반, 그래프 기반 특징이었으며, 'listed_count', 'favourites_by_age', 'friends_by_age'는 가장 영향력 있는 특징 중에 포함되었다.
  • 추가로 잘 알려진 트위터 데이터셋에 모델을 적용한 결과, 다양한 데이터 분포 간에도 강력한 일반화 성능을 보이며, 모델의 견고성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.