Skip to main content
QUICK REVIEW

[논문 리뷰] Low Cost Page Quality Factors To Detect Web Spam

Ashish Chandra|arXiv (Cornell University)|2014. 10. 08.
Spam and Phishing Detection참고 문헌 13인용 수 5
한 줄 요약

이 논문은 웹 스팸을 탐지하기 위해 URL, 콘텐츠, 링크 기능으로 분류된 32개의 저비용 실시간 페이지 품질 요소를 제안한다. 내성적인 역전파 신경망을 사용하여 낮은 CPU 사용량으로 높은 정확도를 달성하여 검색 엔진에서 결과 품질을 유지를 위한 확장 가능한 구현이 가능하다.

ABSTRACT

Web spam is a big challenge for quality of search engine results. It is very important for search engines to detect web spam accurately. In this paper we present 32 low cost quality factors to classify spam and ham pages on real time basis. These features can be divided in to three categories: (i) URL features, (ii) Content features, and (iii) Link features. We developed a classifier using Resilient Back-propagation learning algorithm of neural network and obtained good accuracy. This classifier can be applied to search engine results on real time because calculation of these features require very little CPU resources.

연구 동기 및 목표

  • 검색 엔진 결과 품질을 떨어뜨리는 웹 스팸 문제의 증가에 대응하기 위해.
  • 스팸 및 비스팸(햄) 웹 페이지를 분류하기 위한 확장 가능하고 실시간인 시스템을 개발하기 위해.
  • 스팸과 정상 페이지를 신뢰성 있게 구분할 수 있는 저복잡도이자 계산적으로 효율적인 특징을 식별하기 위해.
  • 낮은 CPU 자원 사용량을 통해 실생활 검색 엔진에 실용적으로 구현할 수 있도록 하기 위해.
  • 비싼 또는 복잡한 분석에 의존하지 않고도 스팸 탐지 정확도를 향상시키기 위해.

제안 방법

  • 저자들은 URL 기능, 콘텐츠 기능, 링크 기능으로 그룹화된 32개의 저비용 품질 요소를 추출한다.
  • 이러한 특징들은 계산적으로 가벼워야 하며, 추출에 최소한의 CPU 자원을 요구한다.
  • 내성적인 역전파(RBF) 신경망을 사용하여 추출된 특징을 바탕으로 페이지를 스팸 또는 햄으로 분류하도록 훈련시킨다.
  • 분류기는 실시간 성능 최적화가 이루어져 검색 엔진 결과 필터링에 즉각 적용할 수 있다.
  • 특징 공학은 URL 구조의 이질성, 콘텐츠 중복성, 의심스러운 링크 패턴과 같은 히ュ리스틱에 초점을 맞춘다.
  • 모델은 실제 세계 데이터를 기반으로 평가되어 낮은 계산 오버헤드로 높은 정확도를 보여준다.

실험 결과

연구 질문

  • RQ1저비용 실시간 특징의 조합이 스팸과 정상 웹 페이지를 효과적으로 구분할 수 있는가?
  • RQ2URL, 콘텐츠, 링크 기반 특징이 스팸 탐지 정확도에 어떻게 종합적으로 기여하는가?
  • RQ3이러한 특징을 기반으로 훈련된 신경망 분류기가 낮은 계산 비용으로 높은 정확도를 달성할 수 있는가?
  • RQ4이러한 시스템은 실시간 검색 엔진 파이프라인에 실용적으로 구현될 수 있는가?
  • RQ5웹 스팸 필터링에서 특징의 복잡도와 성능 간의 상호 교환 관계는 어떠한가?

주요 결과

  • 제안된 시스템은 단지 32개의 저비용 특징만을 사용하여 실시간 스팸 탐지가 가능하며, 높은 분류 정확도를 달성한다.
  • 내성적인 역전파 신경망은 선택된 특징을 바탕으로 스팸 및 햄 페이지를 효과적으로 분류하는 데 성공한다.
  • 특징 추출에 필요한 CPU 자원이 극히 적어 실생활 검색 엔진에서 대규모 배포에 적합하다.
  • URL, 콘텐츠, 링크 기반 특징의 조합은 스팸 탐지에 강력한 신호를 제공한다.
  • 시스템은 실제 세계 데이터에서 뛰어난 성능을 보이며, 실생활 적용 가능성에 대한 검증을 받았다.
  • 이 시스템은 확장 가능하고 효율적이며, 대규모에서 검색 결과 품질을 유지하기 위한 실현 가능한 솔루션을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.