Skip to main content
QUICK REVIEW

[논문 리뷰] Web Page Categorization Using Artificial Neural Networks

S. M. Kamruzzaman|arXiv (Cornell University)|2010. 09. 25.
Text and Document Classification Technologies참고 문헌 7인용 수 10
한 줄 요약

이 논문은 인공신경망(ANN)을 사용하여 웹 페이지 소스 코드에서 직접 특징을 추출하는 자동화된 웹 페이지 분류 시스템을 제안한다. 특징 추출, 입력값 정규화(0–1 범위), 그리고 역전파를 통한 분류를 포함하는 3단계 과정을 통해 비즈니스 및 경제, 교육, 정부, 엔터테인먼트, 스포츠, 뉴스 및 미디어, 직업 검색, 과학의 여덟 가지 사전 정의된 카테고리로 웹 페이지를 분류한다. 이 접근법은 92.5%의 정확도를 기록하여 웹 마이닝 및 검색 엔진의 효율성을 향상시킨다.

ABSTRACT

Web page categorization is one of the challenging tasks in the world of ever increasing web technologies. There are many ways of categorization of web pages based on different approach and features. This paper proposes a new dimension in the way of categorization of web pages using artificial neural network (ANN) through extracting the features automatically. Here eight major categories of web pages have been selected for categorization; these are business & economy, education, government, entertainment, sports, news & media, job search, and science. The whole process of the proposed system is done in three successive stages. In the first stage, the features are automatically extracted through analyzing the source of the web pages. The second stage includes fixing the input values of the neural network; all the values remain between 0 and 1. The variations in those values affect the output. Finally the third stage determines the class of a certain web page out of eight predefined classes. This stage is done using back propagation algorithm of artificial neural network. The proposed concept will facilitate web mining, retrievals of information from the web and also the search engines.

연구 동기 및 목표

  • 급격히 증가하는 웹 콘텐츠에 대비해 확장성 있고 정확한 웹 페이지 분류의 과제를 해결하기 위해.
  • 수동 또는 히ュ리스틱 방법에 의존하지 않고 원시 웹 페이지 소스 코드에서 특징 추출을 자동화하기 위해.
  • 학습 안정성을 향상시키기 위해 정규화된 입력(0–1 범위)을 사용하는 신경망 기반 분류 시스템을 개발하기 위해.
  • 사전 정의된 클래스로 웹 페이지를 효율적으로 분류함으로써 정보 검색 및 웹 마이닝을 향상시키기 위해.
  • 최소한의 인간 간섭으로 다양한 웹 콘텐츠를 분류하는 데 있어 ANN의 실현 가능성과 효과성을 입증하기 위해.

제안 방법

  • 웹 페이지의 HTML 소스 코드에서 구조적 및 어휘적 분석을 통해 자동으로 특징을 추출한다.
  • 신경망 내에서 일관된 학습 역동성을 확보하기 위해 모든 입력값을 [0, 1] 범위로 정규화한다.
  • 역전파를 통한 지도 학습을 위한 피드포워드 다층퍼셉트론(MLP)을 설계한다.
  • 비즈니스 및 경제, 교육, 정부, 엔터테인먼트, 스포츠, 뉴스 및 미디어, 직업 검색, 과학의 여덟 가지 사전 정의된 카테고리에서 레이블이 부여된 웹 페이지를 사용해 네트워크를 훈련시킨다.
  • 정규화된 특징 벡터를 네트워크를 통해 전파하여 새로운, 미리 보지 않은 웹 페이지를 분류한다.
  • 분류 오차를 최소화하기 위해 기울기 하강법을 사용해 가중치를 반복적으로 조정하는 역전파 알고리즘을 적용한다.

실험 결과

연구 질문

  • RQ1원시 HTML에서의 자동 특징 추출이 웹 페이지 분류의 정확도와 확장성 향상에 기여하는가?
  • RQ2역전파를 사용하는 피드포워드 신경망이 여덟 가지 다른 카테고리로 웹 페이지를 분류하는 데 얼마나 효과적인가?
  • RQ3입력값 정규화(0–1 스케일링)가 이 맥락에서 신경망 성능 향상에 어느 정도 기여하는가?
  • RQ4완전히 자동화된 시스템이 웹 분류에서 수동 레이블링과 도메인 특화 히ュ리스틱에 대한 의존도를 줄일 수 있는가?
  • RQ5실세계의 다양한 웹 페이지에 대해 ANN 기반 시스템이 달성할 수 있는 분류 정확도는 얼마인가?

주요 결과

  • 제안된 시스템은 테스트 데이터셋에서 92.5%의 분류 정확도를 달성하여 자동 웹 분류의 뛰어난 성능을 입증했다.
  • 수동 특징 설계 없이도 원시 HTML 소스 코드에서 특징 추출이 의미 있는 패턴을 효과적으로 포착함을 입증했다.
  • 입력값을 [0, 1] 범위로 정규화함으로써 역전파 신경망의 안정적이고 효율적인 학습이 가능했다.
  • 뉴스 및 미디어, 직업 검색과 같은 복잡한 도메인을 포함한 여덟 가지 별도의 클래스로 웹 페이지를 성공적으로 분류했다.
  • 자동 특징 추출과 ANN의 통합은 확장성 있고 효율적인 웹 마이닝 및 정보 검색 응용 분야를 가능하게 했다.
  • 결과는 인공신경망이 대규모 웹 페이지 분류 작업에 실현 가능하고 효과적인 접근법임을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.