Skip to main content
QUICK REVIEW

[論文レビュー] Classifying textual data: shallow, deep and ensemble methods

Laura Anderlucci, Lucia Guastadisegni|arXiv (Cornell University)|Feb 18, 2019
Text and Document Classification Technologies参考文献 15被引用数 5
ひとこと要約

本稿では、イタリアの通信会社の顧客サービス通話の高次元的かつ極めてスパースな短文テキストを分類するため、浅層的・深層学習・アンサンブル手法を評価している。深層ニューラルネットワークが従来手法を上回ることは示されたが、浅層的および深層的モデルを組み合わせたアンサンブルが、より優れたロバスト性と正確性を達成し、誤分類をほぼゼロにまで低減することを示した。

ABSTRACT

This paper focuses on a comparative evaluation of the most common and modern methods for text classification, including the recent deep learning strategies and ensemble methods. The study is motivated by a challenging real data problem, characterized by high-dimensional and extremely sparse data, deriving from incoming calls to the customer care of an Italian phone company. We will show that deep learning outperforms many classical (shallow) strategies but the combination of shallow and deep learning methods in a unique ensemble classifier may improve the robustness and the accuracy of "single" classification methods.

研究の動機と目的

  • 顧客ケアシステムから得られた現実的で高次元的かつ極めてスパースなテキストデータセットに対して、古典的(浅層的)、深層学習、アンサンブル分類手法の性能を評価すること。
  • 平均5語程度の非常に短くスパースな顧客サービス通話の分類という課題に取り組むこと。
  • アンサンブル学習を用いて浅層的および深層的学習モデルを統合することで、個々の手法よりも分類の正確性とロバスト性が向上するかどうかを調査すること。
  • 自動チケット分類の実用的かつ実装可能なソリューションを提供し、顧客サービスの効率性と迅速性を向上させること。

提案手法

  • ナイーブベイズ(ベルヌーイ分布を用いる)、コサイン距離を用いたk-近傍法(k-NN)、シグモイドカーネルを用いたサポートベクターマシン(SVM)を含む古典的手法を適用した。
  • 生のテキスト特徴量から階層的表現を学習するため、フィードフォワード深層ニューラルネットワーク(DNNs)を用いた深層学習モデルを実装した。
  • 高次元的スパースデータに対して強い耐性を示すため、ランダムフォレスト(RFs)を比較のための強力なベースラインとして採用した。
  • 5つのベースモデル(nB、k-NN、SVM、DNNs、RFs)の予測結果を多数決投票によって統合し、全体の正確性を向上させるアンサンブル分類器を構築した。
  • k-NNにおける主な距離尺度およびスパースベクトル空間内での文書類似度測定に、コサイン類似度を用いた。
  • 交差検証を用いてハイパーパrameterを最適化し、信頼性を確保するため、各クラスの精度、再現率、Fスコアを評価した。

実験結果

リサーチクエスチョン

  • RQ1ナイーブベイズ、k-NN、SVMなどの古典的手法(浅層的)は、非常に短くスパースな顧客サービス通話テキストにおいてどの程度の性能を示すか?
  • RQ2スパースで高次元的かつ短文のデータを分類する際、深層ニューラルネットワークは浅層的手法をどの程度上回るか?
  • RQ3多様性のある浅層的および深層的学習モデルのアンサンブルは、個々の手法よりも高い正確性とロバスト性を達成できるか?
  • RQ4この特定のテキスト分類タスクにおいて、モデルの多様性はアンサンブル性能にどのような影響を及えるか?
  • RQ5提案されたアンサンブル戦略は、自動顧客サービスチケットルーティングにおける実世界の展開に実用的かつ十分に効果的か?

主な発見

  • 深層ニューラルネットワーク(DNNs)は、ほとんどの古典的手法を上回り、特にISSおよびTOPカテゴリにおいて、全クラスで高い精度、再現率、Fスコアを達成した。
  • アンサンブル分類器は、最高の全体的正確性とFスコアを達成し、ISSおよびTOPクラスではFスコア1.00を達成し、ACTおよびBALクラスでは0.99を記録した。これは、最良の個々のモデルをも上回った。
  • シグモイドカーネルを用いたSVM、ベルヌーイ分布を用いたナイーブベイズ、コサイン距離を用いた1-NNは、個々のモデルの中で上位に位置し、ほとんどのクラスでFスコア0.98以上を達成した。
  • ランダムフォレストとDNNsは強力な性能を示し、最も頻度の高いクラスではFスコアが0.99および0.98を記録したが、DNNsはより高い計算コストを要した。
  • アンサンブル手法により誤分類が極めて小さな割合にまで低減され、モデルを統合することで、個々のモデルの長所を上回るロバスト性と一般化性能が向上することを示した。
  • 低レベルの多様性(YuleのQが最小0.84)であったにもかかわらず、アンサンブルは依然として非常に効果的であった。これは、この文脈では多様性が高性能を達成するための厳密な前提条件ではないことを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。