Skip to main content
QUICK REVIEW

[논문 리뷰] Botnet Campaign Detection on Twitter

Jeremy Fields|arXiv (Cornell University)|2018. 08. 29.
Spam and Phishing Detection참고 문헌 2인용 수 4
한 줄 요약

이 논문은 시간적 유사성과 인접 트윗 간 속성 일관성을 분석하여 트위터에서 봇넷 캠페인을 실시간으로 가볍게 탐지하는 방법을 제안한다. 이 방법은 920,008개의 트윗에서 14,585개의 봇을 높은 속도와 낮은 계산 비용으로 탐지하며, 전통적인 기계학습 및 네트워크 분석 방법보다도 조정된 스팸 캠페인에 대해 실시간성과 확장성 면에서 뛰어나다.

ABSTRACT

This is an approach to detecting a subset of bots on Twitter, that at best is under-researched. This approach will be generic enough to be adaptable to most, if not all social networks. The subset of bots this focuses on are those that can evade most, if not all current detection methods. This is simply because they have little to no information associated with them that can be analyzed to make a determination. Although any account on any social media site inherently has information associated with it, it is very easy to blend in with the majority of users who are simply "lurkers" - those who only consume content, but do not contribute. How can you determine if an account is a bot if they don't do anything? By the time they act, it will be too late to detect. The only solution would be a real time, or near real-time, detection algorithm.

연구 동기 및 목표

  • 기존 탐지 방법에서 벗어나 무기동성이나 인간의 '관찰자'처럼 행동하는 봇넷 캠페인을 회피하는 조정된 트위터 봇넷 캠페인 탐지의 과제를 해결하기 위해.
  • 역사적 데이터, 네트워크 분석, 또는 복잡한 기계학습 모델에 의존하지 않는 실시간 탐지 시스템을 개발하기 위해.
  • 행동 및 텍스트 일관성을 중시하여 트윗의 속성을 그와 가장 가까운 N개의 시간순서 기반 이웃 트윗과 비교함으로써 봇넷을 식별하기 위해.
  • 고속도 소셜 미디어 스트림에 배포 가능한 확장성 있고 계산 비용이 낮은 탐지 방법을 제공하기 위해.
  • 반응형 탐지 전략의 지연을 극복하기 위해 봇이 행동하기 전에 봇넷을 탐지할 수 있도록 하기 위해.

제안 방법

  • 이 방법은 각 트윗의 속성을 시간 순서로 가장 가까운 N개의 트윗과 비교함으로써 실시간 분석을 수행하며, N개의 트윗으로 이루어진 슬라이딩 윈도우를 사용한다.
  • 텍스트 유사도, 언어, 사용자 에이전트, 위치, 프로필 URL, 감성 등 12개의 속성에 대해 각각 0에서 N의 스코어를 계산한다.
  • 모든 속성에 걸쳐 복합 스코어를 계산하며, 부울이 아닌 속성에 대해 임계값을 적용한다(예: 텍스트 유사도 임계값은 0.6으로 설정한다).
  • 복합 스코어가 가능한 최대 스코어의 사전 정의된 퍼센티지 이상일 경우 봇으로 분류한다.
  • 계정의 역사를 비롯해 네트워크 구조나 복잡한 모델에 의존하지 않으며, 오직 국소적인 시간적 일관성에 집중한다.
  • 설정 가능한 스코어링 시스템을 사용하며, 다중 계수와 임계값을 통해 다양한 데이터 소스와 탐지 목표에 적응 가능하다.

실험 결과

연구 질문

  • RQ1역사적 데이터나 네트워크 분석에 의존하지 않고도 가벼우면서 실시간으로 트위터에서 조정된 봇넷 캠페인을 탐지할 수 있는가?
  • RQ2인접 트윗 간 시간적 속성 일관성이 봇넷 활동을 식별하는 데 얼마나 효과적인가?
  • RQ3간단한 비교 기반 시스템이 침투성과 낮은 활동도를 보이는 봇넷을 탐지하는 데 있어 복잡한 기계학습 모델을 능가할 수 있는가?
  • RQ4속성 유사도에 대한 최적의 임계값과 다중 계수는 무엇인가? 이는 봇넷 캠페인 탐지 정확도를 높이는 데 기여하는가?
  • RQ5이 방법은 트위터의 파이어호스처럼 고속도 데이터 스트림에 얼마나 잘 확장될 수 있는가?

주요 결과

  • 이 방법은 920,008개의 트윗에서 14,585개의 봇 계정을 탐지하였으며, 이 중 10,998개는 고유한 계정으로, 높은 탐지 커버리지를 보여주었다.
  • 탐지된 2,586개의 봇 계정 중 2,586개가 트위터에 의해 정지되거나 삭제되어, 시스템의 정확성과 실제 적용 가능성에 대한 검증이 이루어졌다.
  • 시스템은 수집된 데이터보다 5배 이상 더 빠르게 데이터를 분석하였으며, 5시간 45분 만에 920,008개의 트윗을 처리하였다.
  • 슬라이딩 윈도우 내 20개 트윗 중 17개가 높은 텍스트 유사도(스코어 > 0.6)를 보일 경우 강력한 봇 활동 신호로 관찰되었으며, 이는 조정된 메시징 전략을 시사한다.
  • 위치 및 타임존 데이터가 일관되지 않거나 누락되어도 일관된 프로필 URL, 설명, 사용자 에이전트를 통해 봇넷을 식별할 수 있었다.
  • 이 방법은 최소한의 계산 비용으로 높은 성능을 달성하였으며, 단일 소비자용 기기에서 파이썬으로 실행되었고, 최적화 또는 분산 처리를 통해 더욱 확장 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.