Skip to main content
QUICK REVIEW

[논문 리뷰] Modeling Review Spam Using Temporal Patterns and Co-bursting Behaviors

Huayi Li, Geli Fei|arXiv (Cornell University)|2016. 11. 21.
Spam and Phishing Detection참고 문헌 26인용 수 12
한 줄 요약

이 논문은 Dianping.com의 대규모 실세계 데이터셋을 기반으로, 단지 리뷰 타임스탬프만을 사용하여 활성 및 비활성 상태로 구성된 이중 모드 시간적 게시 패턴을 분석함으로써 의견 스팸러를 탐지하는 두 모드의 레이블러드 히든 마르코프 모델(LHMM)을 제안한다. 또한, 다수의 제품을 통해 동기화된 리뷰 폭발을 포착하는 공범 스팸러 그룹을 드러내기 위해 공범 네트워크(co-bursting network)를 도입하여, 최신 기술 대비 스팸러 탐지 및 그룹 클러스터링 성능을 크게 향상시켰다.

ABSTRACT

Online reviews play a crucial role in helping consumers evaluate and compare products and services. However, review hosting sites are often targeted by opinion spamming. In recent years, many such sites have put a great deal of effort in building effective review filtering systems to detect fake reviews and to block malicious accounts. Thus, fraudsters or spammers now turn to compromise, purchase or even raise reputable accounts to write fake reviews. Based on the analysis of a real-life dataset from a review hosting site (dianping.com), we discovered that reviewers' posting rates are bimodal and the transitions between different states can be utilized to differentiate spammers from genuine reviewers. Inspired by these findings, we propose a two-mode Labeled Hidden Markov Model to detect spammers. Experimental results show that our model significantly outperforms supervised learning using linguistic and behavioral features in identifying spammers. Furthermore, we found that when a product has a burst of reviews, many spammers are likely to be actively involved in writing reviews to the product as well as to many other products. We then propose a novel co-bursting network for detecting spammer groups. The co-bursting network enables us to produce more accurate spammer groups than the current state-of-the-art reviewer-product (co-reviewing) network.

연구 동기 및 목표

  • 실세계 리뷰 데이터를 기반으로 위조 리뷰어와 진짜 리뷰어 간의 구분 가능한 시간적 게시 패턴을 식별하기 위해.
  • 이중 모드 게시 행동을 활용하여 개인의 의견 스팸러를 탐지할 수 있도록 레이블러드 히든 마르코프 모델(LHMM)을 개발하기 위해.
  • 다양한 제품을 통해 동기화된 리뷰 폭발을 포착함으로써 공동 스팸 행위를 모델링하기 위해 공범 네트워크(co-bursting network)를 도입하기 위해.
  • 정확한 스팸 레이블이 부여된 대규모 실생활 데이터셋을 기반으로 제안된 방법을 평가하여 최신 기술 대비 신뢰할 수 있는 비교가 가능하도록 하기 위해.

제안 방법

  • 저자들은 활성(높은 게시 빈도) 및 비활성(낮은 게시 빈도) 상태를 가진 이중 상태 히든 마르코프 모델(HMM)로 리뷰어의 게시 행동을 모델링한다.
  • 사용자의 시간적 게시 패턴에 기반해 스팸러일 가능성을 추정하기 위해 HMM을 레이블러드 HMM(LHMM)로 확장한다.
  • 모델은 리뷰의 타임스탬프만을 사용하므로 경량이며 다양한 리뷰 플랫폼에 적용 가능하다.
  • 다양한 제품을 통해 동기화된 리뷰 폭발을 보이는 리뷰어들을 연결하여 공범 네트워크를 구축한다. 이는 공모 스팸 행위를 포착한다.
  • 클러스터링 알고리즘(Louvain, K-means, 계층적)을 공범 네트워크에 적용하여 스팸러 그룹을 탐지한다.
  • 정확도 평가 지표로 순수도(purity)와 엔트로피(entropy)를 사용하여 탐지된 스팸러 그룹의 품질을 참값과 비교한다.

실험 결과

연구 질문

  • RQ1스팸러와 진짜 리뷰어는 실세계 리뷰 데이터에서 구분 가능한 이중 모드 시간적 게시 패턴을 보이는가?
  • RQ2단지 리뷰 타임스탬프와 시간적 행동만을 사용하여 레이블러드 히든 마르코프 모델이 개인 스팸러를 효과적으로 탐지할 수 있는가?
  • RQ3스팸러들은 다수의 제품을 통해 자주 동기화된 리뷰 폭발을 일으키는가? 이는 공모 행위를 시사하는가?
  • RQ4기존의 공리뷰 네트워크와 비교할 때 공범 네트워크는 공모 스팸러 그룹을 탐지하는 데 더 나은 성능을 보이는가?
  • RQ5LHMM의 은닉 상태는 공동 스팸 활동을 드러내는 신뢰할 수 있는 지표가 될 수 있는가?

주요 결과

  • LHMM 모델은 언어적 및 행동적 특징을 사용하는 지도 학습 기반 방법보다 개인 스팸러 탐지에서 유의미하게 높은 정확도를 달성하며, 시간 패턴 분석을 통해 성능을 향상시킨다.
  • 스팸러는 진짜 리뷰어에 비해 연속적인 리뷰 간 평균 간격이 훨씬 짧은 것으로 확인되어, 명백한 게시 행동의 차이를 입증한다.
  • 스팸러는 비활성 상태에서 활성 상태로의 전환 빈도가 더 높고, 폭발적인 활동 빈도를 보이며, 비스팸어는 반대로 그 반대의 패턴을 보인다.
  • 공범 네트워크는 공리뷰 네트워크보다 더 높은 클러스터링 순수도(0.88)와 낮은 엔트로피(0.76)를 기록하여, 공모 스팸러 그룹 탐지에서 뛰어난 성능을 보였다.
  • 근처에 위치한 레스토랑의 일일 위조 리뷰 폭발 사이에 강한 정적 상관관계가 존재하며, 이는 공통의 스팸어 커뮤니티가 주도하는 공동 스팸 캠페인을 시사한다.
  • 모델의 은닉 상태는 효과적으로 공모 행동을 드러내어, 기존 특징 기반 필터링에서 빠지는 어려운 스팸어 그룹을 탐지하는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.