Skip to main content
QUICK REVIEW

[論文レビュー] Towards Automated Website Classification by Deep Learning

Fabrizio De Fausti, Francesco Pugliese|arXiv (Cornell University)|Oct 22, 2019
Web Data Mining and Analysis被引用数 4
ひとこと要約

本論文では、畳み込みニューラルネットワーク(CNN)とワード埋め込みを用いた深層学習パイプラインを提案し、eコマースなど、イタリア企業のウェブサイトを分類する。生のウェブテキストを信号対ノイズ比を向上させるために画像に類似した行列に変換する。このアプローチは、Istatでテストされた従来の機械学習手法を著しく上回り、公式統計応用分野における自動ウェブサイト分類で最先端の結果を達成した。

ABSTRACT

In recent years, the interest in Big Data sources has been steadily growing within the Official Statistic community. The Italian National Institute of Statistics (Istat) is currently carrying out several Big Data pilot studies. One of these studies, the ICT Big Data pilot, aims at exploiting massive amounts of textual data automatically scraped from the websites of Italian enterprises in order to predict a set of target variables (e.g. e-commerce) that are routinely observed by the traditional ICT Survey. In this paper, we show that Deep Learning techniques can successfully address this problem. Essentially, we tackle a text classification task: an algorithm must learn to infer whether an Italian enterprise performs e-commerce from the textual content of its website. To reach this goal, we developed a sophisticated processing pipeline and evaluated its performance through extensive experiments. Our pipeline uses Convolutional Neural Networks and relies on Word Embeddings to encode raw texts into grayscale images (i.e. normalized numeric matrices). Web-scraped texts are huge and have very low signal to noise ratio: to overcome these issues, we adopted a framework known as False Positive Reduction, which has seldom (if ever) been applied before to text classification tasks. Several original contributions enable our processing pipeline to reach good classification results. Empirical evidence shows that our proposal outperforms all the alternative Machine Learning solutions already tested in Istat for the same task.

研究の動機と目的

  • ウェブスクリーピングから得たテキストコンテンツに基づいて、イタリア企業のウェブサイトを自動で分類するシステムを開発すること。
  • 企業ウェブサイトの大量で生のテキストデータにおける低信号対ノイズ比の課題に対処すること。
  • eコマース活動などのICT調査変数を予測する際、深層学習モデルと従来の機械学習アプローチの性能を比較すること。
  • これまでテキスト分類であまり使われてこなかった、偽陽性低減フレームワークを適用し、モデルの頑健性と正確性を向上させること。
  • 公式統計の支援を目的として、手動調査への依存を減らし、スケーラブルで自動化されたウェブソースからのデータ収集を可能とすること。

提案手法

  • テキストの意味的意味を保持するように、ワード埋め込みを用いて生のウェブサイトテキストを正規化された数値行列( shade 画像)に変換する。
  • 畳み込みニューラルネットワーク(CNN)が、テキストデータから階層的特徴を学習する画像に類似した表現を処理する。
  • ノイズが多いまたは関係のない予測をフィルタリングするため、偽陽性低減フレームワークをパイプラインに統合する。
  • テキスト前処理には正規化、トークン化、埋め込みマッピングが含まれ、次元削減とモデルの一般化性能の向上を図る。
  • eコマースの有無などの目的変数でアノテートされた、イタリア企業ウェブサイトの大規模データセット上で、エンドツーエンドにモデルを学習する。
  • 標準的な自然言語処理指標(例:F1スコア、適合率、再現率)を用いて、複数の分類タスクにおける性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1テキストコンテンツのみを用いて、eコマースなどの事前に定義されたカテゴリに企業ウェブサイトを効果的に分類できるか?
  • RQ2偽陽性低減の統合は、低信号・高ノイズのウェブデータにおけるテキスト分類の頑健性をどのように向上させるか?
  • RQ3ワード埋め込みを組み合わせたCNNベースのモデルは、従来の機械学習手法に比べて、企業ウェブサイト分類でどれほど優れた性能を発揮するか?
  • RQ4テキスト前処理および埋め込み技術の影響は、実世界のウェブデータにおけるモデル性能にどのように現れるか?
  • RQ5自動ウェブサイト分類は、公式統計における手動データ収集の負担を軽減できるか?

主な発見

  • 提案された深層学習パイプラインは、Istatで以前にテストされたすべての従来の機械学習モデルよりも優れた性能を示した。
  • ワード埋め込みとCNNの組み合わせにより、生で非構造化されたウェブサイトテキストから効果的な特徴抽出が可能になった。
  • 偽陽性低減フレームワークの適用により、ノイズの多いウェブデータにおけるモデルの適合率が著しく向上し、誤った予測が減少した。
  • モデルはさまざまな企業セクターにわたって優れた一般化性能を示し、eコマース分類においても高いF1スコアを維持した。
  • 実証的結果から、深層学習アプローチが、実世界のウェブコンテンツの複雑さと多様性に対処する上で、古典的手法を上回ることが確認された。
  • 本システムは、公式統計における従来の調査ベースのデータ収集に代わる、スケーラブルで自動化された代替手段を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。