Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Automated Website Classification by Deep Learning

Fabrizio De Fausti, Francesco Pugliese|arXiv (Cornell University)|2019. 10. 22.
Web Data Mining and Analysis인용 수 4
한 줄 요약

이 논문은 이탈리아 기업 웹사이트를 전자상거래 등과 같은 카테고리로 분류하기 위해 컷팅 네트워크(CNNs)와 워드 임베딩을 사용하는 딥러닝 파이프라인을 제안한다. 원시 웹 텍스트를 신호 대 잡음 비율을 향상시키기 위해 이미지 유사 행렬로 변환한다. 이 방법은 Istat에서 테스트한 전통적인 기계학습 방법보다 뚜렷하게 뛰어난 성능을 보이며 공식 통계 응용 분야에서 최신 기술 수준의 자동 웹사이트 분류 결과를 달성한다.

ABSTRACT

In recent years, the interest in Big Data sources has been steadily growing within the Official Statistic community. The Italian National Institute of Statistics (Istat) is currently carrying out several Big Data pilot studies. One of these studies, the ICT Big Data pilot, aims at exploiting massive amounts of textual data automatically scraped from the websites of Italian enterprises in order to predict a set of target variables (e.g. e-commerce) that are routinely observed by the traditional ICT Survey. In this paper, we show that Deep Learning techniques can successfully address this problem. Essentially, we tackle a text classification task: an algorithm must learn to infer whether an Italian enterprise performs e-commerce from the textual content of its website. To reach this goal, we developed a sophisticated processing pipeline and evaluated its performance through extensive experiments. Our pipeline uses Convolutional Neural Networks and relies on Word Embeddings to encode raw texts into grayscale images (i.e. normalized numeric matrices). Web-scraped texts are huge and have very low signal to noise ratio: to overcome these issues, we adopted a framework known as False Positive Reduction, which has seldom (if ever) been applied before to text classification tasks. Several original contributions enable our processing pipeline to reach good classification results. Empirical evidence shows that our proposal outperforms all the alternative Machine Learning solutions already tested in Istat for the same task.

연구 동기 및 목표

  • 웹 스크래핑을 통해 수집한 텍스트 내용을 기반으로 이탈리아 기업 웹사이트를 자동으로 분류하는 시스템을 개발하는 것.
  • 기업 웹사이트에서 얻은 대규모 원시 웹 텍스트에서 낮은 신호 대 잡음 비율 문제를 해결하는 것.
  • 전자상거래 활동과 같은 ICT 조사 변수를 예측하는 데 있어 딥러닝 모델과 전통적인 기계학습 접근법의 성능을 평가하는 것.
  • 이전에 텍스트 분류에서 거의 사용되지 않았던 가짜 양성 감소(Falsе Positive Reduction) 프레임워크를 적용하여 모델의 강건성과 정확도를 향상시키는 것.
  • 수동 조사에 의존도를 줄이고 확장 가능하고 자동화된 웹 소스 데이터 수집을 가능하게 하여 공식 통계를 지원하는 것.

제안 방법

  • 워드 임베딩을 사용하여 원시 웹사이트 텍스트를 정규화된 숫자 행렬(grayscale 이미지)로 변환함으로써 의미를 유지한다.
  • 컷팅 네트워크(CNN)가 텍스트 데이터에서 계층적 특징을 학습하기 위해 이러한 이미지 유사 표현을 처리한다.
  • 파이프라인은 잡음이 많거나 관련성이 없는 예측을 걸러내기 위해 가짜 양성 감소 프레임워크를 통합한다. 이는 분류 신뢰도를 향상시킨다.
  • 텍스트 전처리에는 정규화, 토큰화, 임베딩 매핑이 포함되어 차원을 줄이고 모델의 일반화 능력을 향상시킨다.
  • 모델은 전자상거래 존재 여부와 같은 목표 변수로 주석이 달린 대규모 이탈리아 기업 웹사이트 데이터셋을 기반으로 엔드 투 엔드로 훈련된다.
  • 성능 평가는 전자상거래 분류와 같은 여러 분류 작업에서 표준 NLP 지표(예: F1 점수, 정밀도, 재현율)를 사용하여 평가된다.

실험 결과

연구 질문

  • RQ1딥러닝 모델은 텍스트 내용만을 사용하여 전자상거래와 같은 사전 정의된 카테고리로 기업 웹사이트를 효과적으로 분류할 수 있는가?
  • RQ2가짜 양성 감소 통합이 낮은 신호, 높은 잡음의 웹 데이터에서 텍스트 분류의 강건성을 어떻게 향상시키는가?
  • RQ3워드 임베딩을 사용하는 CNN 기반 모델이 기업 웹사이트 분류에서 전통적인 기계학습 방법보다 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ4텍스트 전처리 및 임베딩 기법이 실제 웹 데이터에서 모델 성능에 어떤 영향을 미치는가?
  • RQ5자동 웹사이트 분류가 공식 통계에서 수동 데이터 수집의 부담을 줄일 수 있는가?

주요 결과

  • 제안된 딥러닝 파이프라인은 Istat에서 이전에 테스트한 모든 전통적 기계학습 모델보다 동일한 분류 작업에서 뛰어난 성능을 달성했다.
  • 워드 임베딩과 CNN의 조합을 통해 원시 비정형 웹사이트 텍스트에서 효과적인 특징 학습이 가능했다.
  • 가짜 양성 감소 프레임워크는 잡음이 많은 웹 데이터에서 모델의 정밀도를 크게 향상시키고 잘못된 예측을 줄였다.
  • 모델은 다양한 기업 부문에서 강력한 일반화 능력을 보이며 전자상거래 분류에서 높은 F1 점수를 유지했다.
  • 실증 결과는 딥러닝 접근법이 실제 웹 콘텐츠의 복잡성과 다양성을 다루는 데 있어 고전적 방법보다 더 효과적임을 확인했다.
  • 이 시스템은 수동 조사 기반 데이터 수집의 확장 가능하고 자동화된 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.