Skip to main content
QUICK REVIEW

[논문 리뷰] Web Usage mining framework for Data Cleaning and IP address Identification

Priyanka Verma, Nishtha Kesswani|arXiv (Cornell University)|2014. 08. 23.
Web Data Mining and Analysis참고 문헌 9인용 수 5
한 줄 요약

이 논문은 웹 로그 사전처리 단계에서 데이터 정제 및 IP 주소 식별에 중점을 둔 웹 사용량 마이닝 프레임워크를 제안한다. 노이즈가 많은 로그 항목을 걸러내고 정확하게 고유 사용자를 식별하기 위한 방법론을 도입하여 사전처리 후 식별 가능한 사용자 수를 줄이고, 후속 분석을 위한 데이터 품질을 향상시킨다.

ABSTRACT

The World Wide Web is the most wide known information source that is easily available and searchable. It consists of billions of interconnected documents Web pages are authored by millions of people. Accesses made by various users to pages are recorded inside web logs. These log files exist in various formats. Because of increase in usage of web, size of web log files is increasing at a much faster rate. Web mining is application of data mining technique to these log files. It can be of three types Web usage mining, Web structure mining and Web content mining. Web Usage mining is mining of usage patterns of users which can then be used to personalize web sites and create attractive web sites. It consists of three main phases: Preprocessing, Pattern discovery and Pattern analysis. In this paper we focus on Data cleaning and IP Address identification stages of preprocessing. Methodology has been proposed for both the stages. At the end conclusion is made about number of users left after IP address identification.

연구 동기 및 목표

  • 대규모 웹 사용량 마이닝에서 노이즈가 많고 일관성 없는 웹 로그 데이터에 대응하고자 한다.
  • 웹 로그 사전처리 단계에서 체계적인 데이터 정제 접근 방식을 개발하여 데이터 품질을 향상시키고자 한다.
  • 웹 로그에서 IP 주소 해석을 통해 고유 사용자를 정확히 식별하고자 한다.
  • 중복되거나 유효하지 않은 항목을 제거하여 데이터 중복을 줄이고자 한다.
  • 개선된 사전처리를 통해 신뢰할 수 있는 사용자 행동 분석 기반을 제공하고자 한다.

제안 방법

  • 웹 로그의 데이터 정제 및 IP 주소 식별에 중점을 둔 구조화된 사전처리 파이프라인을 제안한다.
  • 잘못된, 불완전하거나 손상된 로그 항목을 제거하기 위해 데이터 정제 기법을 적용한다.
  • 로그 항목을 개별 사용자 또는 세션으로 매핑하기 위해 IP 주소 식별을 구현한다.
  • 패턴 기반 필터링을 사용하여 정상적인 접근 기록과 비정상적인 기록을 구분한다.
  • 일관된 파싱을 위해 표준 웹 로그 형식(예: W3C, Common Log)을 입력으로 사용한다.
  • IP 주소 형식의 정규화 및 표준화를 적용하여 로그 간 일관성을 확보한다.

실험 결과

연구 질문

  • RQ1웹 로그 데이터는 어떻게 효과적으로 정제할 수 있을까? 이는 사용량 마이닝을 위한 데이터 품질 향상에 기여한다.
  • RQ2웹 로그에서 IP 주소로부터 고유 사용자를 정확히 식별할 수 있는 기법은 무엇인가?
  • RQ3데이터 정제 과정이 노이즈를 얼마나 줄이고 사용자 식별 정확도를 얼마나 향상시키는가?
  • RQ4제안된 프레임워크는 로그 파일 형식과 구조의 불일치를 어떻게 처리하는가?
  • RQ5사전처리가 IP 해석 후 식별 가능한 사용자 수에 어떤 영향을 미치는가?

주요 결과

  • 데이터 정제 단계에서 유효하지 않거나 손상된 로그 항목의 상당 부분이 성공적으로 제거되어 데이터 무결성이 향상되었다.
  • IP 주소 식별 과정이 로그 항목을 고유 사용자 세션으로 효과적으로 매핑하여 중복을 줄였다.
  • 사전처리 후 식별 가능한 사용자 수가 감소하여 효과적인 중복 제거 및 노이즈 제거가 이루어졌음을 나타냈다.
  • 다양한 웹 로그 형식에서 일관된 성능을 보여주어 확장성이 확보되었다.
  • 사전처리 파이프라인이 후속 사용자 행동 분석의 신뢰성에 크게 기여했다.
  • 연구 결과는 적절한 데이터 정제 및 IP 해석이 정확한 웹 사용량 마이닝을 위해 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.