Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient filtering of adult content using textual information

Thomas Largillier, Guillaume Peyronnet|arXiv (Cornell University)|2015. 12. 01.
Web Data Mining and Analysis참고 문헌 4인용 수 4
한 줄 요약

이 논문은 결정수림을 사용한 텍스트 기반 필터링 방법을 제안하여 성인 콘텐츠가 포함되지 않은 검색 엔진 인덱스를 구축한다. 테스트 데이터셋에서 정확도 97.22%, 재현율 97.85%를 달성한다. 이 방법은 텍스트 콘텐츠와 URL 특성에만 의존하며, 성인 콘텐츠를 표시하는 것 대신 대부분의 성인 사이트를 인덱스에서 제거하여 성인 콘텐츠 노출을 효과적으로 줄인다.

ABSTRACT

Nowadays adult content represents a non negligible proportion of the Web content. It is of the utmost importance to protect children from this content. Search engines, as an entry point for Web navigation are ideally placed to deal with this issue. In this paper, we propose a method that builds a safe index i.e. adult-content free for search engines. This method is based on a filter that uses only textual information from the web page and the associated URL.

연구 동기 및 목표

  • 옵션형 안전 검색 기능에 의존하지 않고 성인 콘텐츠가 포함되지 않은 검색 엔진 인덱스를 구축하는 방법을 개발하는 것.
  • 어린이의 웹 상의 안전을 향상시키기 위해 성인 웹사이트를 사전에 검색 결과에서 제외함으로써 주도적으로 대처하는 것.
  • 단어 빈도, URL 구조, 메타데이터와 같은 순수 텍스트 기반 특성의 성능을 평가하여 성인 콘텐츠를 탐지하는 데 얼마나 효과적인지 확인하는 것.
  • 표현적인 텍스트 마커가 없는 경우에도 높은 재현율을 확보하면서 거짓 경고를 최소화하는 것.

제안 방법

  • 웹 페이지와 URL에서 추출한 36개의 텍스트 및 구조적 특성에 기반한 지도 학습 파이프라인을 사용하며, 이는 결정수림 모델에 의해 학습된다.
  • 주요 특성으로는 영어 성인어 비율(ratio_wen), 프랑스어 성인어 비율(prop_wfr), URL 기반 특성(IN-URL, ratio_brand), 그리고 이미지 수와 태그 빈도와 같은 구조적 요소가 포함된다.
  • 모든 결합수림 트리의 다수결 투표를 통해 최종 분류를 결정하며, 민감도와 특이도를 조절할 수 있는 조정 가능한 임계값을 사용한다.
  • 이 필터는 이미지나 영상 분석을 포함하지 않고 텍스트 및 URL 기반 특성만을 사용하여 처리 속도와 확장성을 유지한다.
  • 시스템은 성인 웹사이트를 인덱스에서 완전히 제거하도록 설계되어 있어, 이로 인해 페이지랭크가 감소하고 검색 결과에서의 노출도 최소화된다.
  • 추가로 TLD 확인, 고지문 검출, 블랙리스트 업데이트와 같은 메커니즘을 고려하여 성능을 더욱 향상시키고자 한다.

실험 결과

연구 질문

  • RQ1순수 텍스트 기반 필터링 시스템이 검색 엔진 인덱스에서 성인 콘텐츠를 식별하고 제외하는 데 있어 높은 정확도를 달성할 수 있는가?
  • RQ2이미지나 영상 분석에 의존하지 않고 URL 기반 특성과 단어 빈도 패턴은 성인 콘텐츠 탐지에 얼마나 효과적인가?
  • RQ3성인 웹사이트를 인덱스에서 제거함으로써 그들의 검색 결과 노출도와 순위에 어떤 영향을 미치는가?
  • RQ4언어별 성인어 비율과 태그 사용과 같은 다양한 텍스트 기반 특성은 분류 성능에 어떤 기여를 하는가?

주요 결과

  • 테스트 세트 1,153개 웹 페이지(성인 사이트 839개, 안전 사이트 314개)에서 필터는 97.22% 정확도, 97.85% 재현율, 98.32% 정밀도를 기록했다.
  • 오류율은 단지 2.15%에 불과하여 시스템이 대부분의 성인 콘텐츠를 성공적으로 식별했다는 것을 시사한다.
  • 거짓 음성 결과는 Beeg와 같이 텍스트 콘텐츠가 극히 적고 명시적인 성인 키워드가 없는 비디오 스트리밍 사이트에서 주로 발생했다.
  • 비표준적인 섹션에서 경미하게 명시적인 콘텐츠를 포함한 포럼도 잘못 탐지된 경우가 있었지만, 이는 성인 콘텐츠의 소수에 해당한다.
  • IN-URL, ratio_brand, ratio_queries 등의 특성은 70% 이상의 분류에서 사용되어 URL 구조가 탐지에 있어 매우 중요한 역할을 한다는 점을 입증한다.
  • 텍스트 콘텐츠에만 의존함으로써 97.22%의 경우에서 충분한 성능을 달성했으며, 이는 비시각적 특성이 성인 콘텐츠 필터링에 매우 효과적이라는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.