Skip to main content
QUICK REVIEW

[논문 리뷰] Detection of Fake Users in SMPs Using NLP and Graph Embeddings

Manojit Chakraborty, Shubham Das|arXiv (Cornell University)|2021. 04. 27.
Spam and Phishing Detection참고 문헌 21인용 수 4
한 줄 요약

이 논문은 사용자 메타데이터, NLP로 추출한 텍스트 특징, 그리고 팔로워-팔로잉 네트워크에서 유도된 그래프 임베딩을 조합하여 진짜 사용자와 가짜 사용자를 구분하는 새로운 스팸 검출 방법을 제안한다. 최근의 더 어려운 데이터를 기반으로 XGBoost를 사용하여 46,354개의 활성 계정으로 구성된 새로 수집된 최신 데이터셋에서 96.99%의 정확도를 달성하였으며, 이는 이전의 연구를 능가하는 성능이다.

ABSTRACT

Social Media Platforms (SMPs) like Facebook, Twitter, Instagram etc. have large user base all around the world that generates huge amount of data every second. This includes a lot of posts by fake and spam users, typically used by many organisations around the globe to have competitive edge over others. In this work, we aim at detecting such user accounts in Twitter using a novel approach. We show how to distinguish between Genuine and Spam accounts in Twitter using a combination of Graph Representation Learning and Natural Language Processing techniques.

연구 동기 및 목표

  • 기존의 검출 시스템을 회피하는 현대의 스팸 및 가짜 계정을 탐지하는 데 도전하는 것.
  • 이미 오래되었거나 비활성화된 계정에 의존하는 기존 데이터셋의 한계를 극복하여 현재의 스팸 행동 양태를 반영하지 못하는 문제를 해결하는 것.
  • 사용자 메타데이터, NLP 기법, 그리고 그래프 기반 표현을 조합하여 현재의 활성 계정에서 높은 정확도로 스팸 계정을 탐지할 수 있는 견고한 탐지 프레임워크를 개발하는 것.
  • 트위터 자체의 스팸 필터를 통과한 많은 계정을 포함하여 46,354개의 활성 트위터 계정으로 구성된 새로운 최신 데이터셋을 구축하여 현실적이고 탐지가 어려운 스팸 계정에서 훈련하고 평가하는 것.

제안 방법

  • 공개 자료와 트위터 API를 통해 126,503개의 트위터 사용자 ID를 수집하고, 비활성 계정을 걸러내어 검증된 레이블이 부여된 46,354개의 활성 계정을 확보하였다.
  • 트위터 API를 통해 각 사용자에 대해 37개의 사용자 메타데이터 특징(예: 팔로워 수, 인증 상태, 계정 생성 일자)과 전체 트윗 텍스트를 추출하였다.
  • TF-IDF와 BERT 기반 문장 임베딩을 사용하여 트윗 내용의 언어 패턴을 포착하는 NLP 기반 특징을 생성하였다.
  • 사용자 간 연결 관계에서 팔로워-팔로잉 그래프를 구축하고, 중심성 측정치(도수, 중간성, 고유벡터 중심성, PageRank)와 node2vec 임베딩을 계산하여 네트워크 내에서의 구조적 역할을 포착하였다.
  • 메타데이터, NLP, 그래프 특징을 통합하여 사용자당 116차원의 통합 특징 벡터를 구성하여 모델 입력으로 사용하였다.
  • 여러 가지 지도 학습 기반 머신러닝 모델을 훈련하고 평가하였으며, 하이퍼파라미터 튜닝을 위해 그리드 서치를 수행한 결과 XGBoost가 가장 우수한 성능을 보였다(학습률 0.1, 최대 깊이 15).

실험 결과

연구 질문

  • RQ1NLP, 사용자 메타데이터, 그래프 임베딩을 조합한 하이브리드 접근 방식이 기존 검출 시스템을 회피하는 현대의 가짜 트위터 계정을 효과적으로 탐지할 수 있는가?
  • RQ2트위터 자체의 스팸 필터를 통과한 많은 활성 계정을 포함한 새로운 최신 데이터셋에서 훈련된 모델의 성능은 이전의 오래된 데이터셋과 비교해 어떻게 달라지는가?
  • RQ3구조적 특징(예: 중심성, node2vec 임베딩)이 전통적인 메타데이터와 NLP 특징을 넘어서 스팸 탐지 성능을 얼마나 향상시키는가?
  • RQ4BERT 기반 임베딩의 통합이 단순한 NLP 방법보다 스팸 콘텐츠의 미묘한 언어 패턴을 탐지하는 데 모델의 능력을 얼마나 향상시키는가?
  • RQ5이 새로운 도전적인 활성 계정 데이터셋에서 XGBoost의 성능은 SVM, 랜덤 포레스트, GBM 등의 최신 기술 모델들과 비교해 어떻게 나타나는가?

주요 결과

  • XGBoost 모델은 테스트 세트에서 96.99%의 최고 정확도를 기록하였으며, 랜덤 포레스트(94.98%)와 LightGBM(88.49%)와 비교해 뚜렷이 뛰어난 성능을 보였다.
  • 스팸 계정(클래스 1)에 대해 97.90%의 정확도를 달성하여, 비록 현재 활성화되어 있고 플랫폼 수준의 필터를 회피하고 있음에도 불구하고 악성 계정을 강력하게 탐지할 수 있음을 시사한다.
  • 이전 연구들(예: Igawa 등은 96.6%, Varol 등은 95%)이 사용한 더 작은, 오래된 데이터셋과 비교해, 더 큰 규모이자 최신 데이터셋(46,354개의 활성 계정)에서 본 연구의 방법이 뛰어난 성능을 보였다.
  • 모델의 F1 스코어가 0.97이었으며, 이는 진짜 계정과 스팸 계정 모두에서 균형 잡힌 성능을 보여주며 높은 정밀도와 재현율을 의미한다.
  • node2vec 그래프 임베딩과 NLP 특징(특히 BERT 기반 임베딩)의 사용이, 특히 커뮤니티 수준의 행동 양태와 언어 스타일에서 스팸 패턴을 구분하는 데 기여하였다.
  • 데이터셋의 품질—트위터 자체의 스팸 검출을 통과한 활성 계정들만 포함되어 있다는 점을 감안할 때, 96.99%의 정확도는 매우 뚜렷한 성과로, 매우 정교하고 탐지가 어려운 스팸 계정을 탐지한 결과임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.