Skip to main content
QUICK REVIEW

[논문 리뷰] Combating Fraud in Online Social Networks: Detecting Stealthy Facebook Like Farms

Muhammad Ikram, Lucky Onwuzurike|arXiv (Cornell University)|2015. 06. 01.
Spam and Phishing Detection참고 문헌 27인용 수 3
한 줄 요약

이 논문은 기존의 그래프 공집합 클러스터링 방법으로는 탐지되지 않는 은밀한 페이스북 좋아요 팩토리(like farms)를 탐지하기 위해 타임라인 기반 기계학습 접근법을 제안한다. 사용자 타임라인 게시물의 어휘적 및 비어휘적 특징(예: 어휘 수 감소, 어휘 다양성 저하, 공유 콘텐츠의 반복성 높음)을 분석함으로써, 최대 100% 정밀도와 97% 재현율을 달성하는 SVM 분류기를 구축하였으며, 기존의 그래프 기반 탐지 기법보다 뚜렷이 뛰어난 성능을 보였다.

ABSTRACT

As businesses increasingly rely on social networking sites to engage with their customers, it is crucial to understand and counter reputation manipulation activities, including fraudulently boosting the number of Facebook page likes using like farms. To this end, several fraud detection algorithms have been proposed and some deployed by Facebook that use graph co-clustering to distinguish between genuine likes and those generated by farm-controlled profiles. However, as we show in this paper, these tools do not work well with stealthy farms whose users spread likes over longer timespans and like popular pages, aiming to mimic regular users. We present an empirical analysis of the graph-based detection tools used by Facebook and highlight their shortcomings against more sophisticated farms. Next, we focus on characterizing content generated by social networks accounts on their timelines, as an indicator of genuine versus fake social activity. We analyze a wide range of features extracted from timeline posts, which we group into two main classes: lexical and non-lexical. We postulate and verify that like farm accounts tend to often re-share content, use fewer words and poorer vocabulary, and more often generate duplicate comments and likes compared to normal users. We extract relevant lexical and non-lexical features and and use them to build a classifier to detect like farms accounts, achieving significantly higher accuracy, namely, at least 99% precision and 93% recall.

연구 동기 및 목표

  • 기존의 그래프 공집합 클러스터링 사기 탐지 도구가 정상 사용자 행동을 모방하는 은밀한 좋아요 팩토리를 식별하는 데에 한계를 가진다는 문제를 해결하기 위해.
  • 타임라인 기반 특징(어휘적 및 비어휘적)이 좋아요 팩토리 계정과 진짜 사용자 간에 효과적으로 구분될 수 있는지 조사하기 위해.
  • 높은 정확도로 은밀한 좋아요 팩토리 계정을 탐지하기 위해 타임라인 특징을 기반으로 한 지도 학습 분류기를 개발하고 평가하기 위해.
  • 타임라인 기반 특징이 시간적 패tern과 사회적 그래프 패턴만으로는 탐지하기 어려운 고도로 정교하고 저조도의 좋아요 팩토리를 탐지하는 데 더 효과적임을 입증하기 위해.

제안 방법

  • 이전의 해로운 함정 캠페인을 통해 좋아요 팩토리 계정과 정상 사용자 기준군의 타임라인 데이터를 수집하였다.
  • 타임라인 게시물에서 어휘적 특징(어휘 수, 어휘 다양성, 독해도 점수 등)을 추출하였다.
  • 비어휘적 특징(공유 콘텐츠 빈도, 중복 댓글, 반복적인 좋아요 수 등)을 추출하였다.
  • 어휘적 및 비어휘적 특징을 통합된 특징 벡터로 조합하여 분류를 위해 사용하였다.
  • 지표 데이터셋을 바탕으로 SVM, 의사결정트리, AdaBoost, kNN, 랜덤 포레스트, 나이브 베이즈 등 다양한 분류기들을 훈련 및 평가하였다.
  • 모든 캠페인과 특징 세트에서의 성능을 바탕으로 SVM을 최적의 분류기로 선정하였다.

실험 결과

연구 질문

  • RQ1CopyCatch와 SynchroTrap와 같은 그래프 공집합 클러스터링 기법이 정상 사용자 행동을 모방하는 은밀한 좋아요 팩토리를 효과적으로 탐지할 수 있는가?
  • RQ2좋아요 팩토리 계정과 정상 사용자의 타임라인 게시물 간에 어떤 어휘적 및 비어휘적 차이가 존재하는가?
  • RQ3타임라인 특징을 기반으로 훈련된 기계학습 분류기가 그래프 기반 방법보다 더 높은 정확도로 좋아요 팩토리 계정을 탐지할 수 있는가?
  • RQ4어휘적 특징인 어휘 수, 어휘 다양성, 독해도 점수는 좋아요 팩토리 계정과 정상 사용자 게시물 간에 어떻게 다를까?
  • RQ5공유 콘텐츠 및 중복 상호작용과 같은 비어휘적 특징이 좋아요 팩토리 계정과 진짜 사용자 행동 간에 얼마나 효과적으로 차이를 보이는가?

주요 결과

  • CopyCatch와 SynchroTrap와 같은 그래프 공집합 클러스터링 기법은 정상 사용자 행동을 모방함으로써 높은 거짓 양성률을 보이며, 은밀한 좋아요 팩토리를 탐지하는 데에 어려움을 겪는다.
  • 좋아요 팩토리 게시물은 평균적으로 정상 사용자 게시물 대비 43% 어휘 수가 적고, 어휘 다양성이 낮으며, 독해도가著명히 떨어진다.
  • 좋아요 팩토리 게시물의 대부분은 원본이 아닌 공유 콘텐츠로 이루어져 있으며, 반복되는 링크, 기사, 영상들이 포함되어 있어 자동화되거나 반복적인 행동을 시사한다.
  • 어휘적 및 비어휘적 특징을 통합해 훈련한 SVM 분류기는 최대 100% 정밀도와 97% 재현율을 달성하였으며, 모든 캠페인에서 최소 99% 정밀도와 93% 재현율을 확보하였다.
  • SVM 분류기는 의사결정트리, AdaBoost, kNN, 랜덤 포레스트, 나이브 베이즈 등 테스트된 모든 알고리즘보다 탐지 정확도에서 뛰어났다.
  • 정상 사용자 글쓰기 및 상호작용 패턴을 모방하는 데에 높은 비용이 소요되므로, 행동 모방을 통한 회피는 좋아요 팩토리에게 경제적으로 비현실적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.