Skip to main content
QUICK REVIEW

[論文レビュー] A Comparison of Synthetic Oversampling Methods for Multi-class Text Classification

Anna Glazkova|arXiv (Cornell University)|Aug 11, 2020
Text and Document Classification Technologies被引用数 14
ひとこと要約

本論文は、KNN、SVM、およびニューラルネットワーク(FNN、LSTM、BLSTM)を用いた多クラステキスト分類において、合成オーバーサンプリング手法(SMOTE、Borderline SMOTE、ADASYN、ランダムオーバーサンプリング)を評価している。結果として、ADASYNおよびSMOTEは、特にディープラーニングモデルにおいて、マイノリティクラスのF1スコアとリコールを顕著に向上させた。一方、KNNおよびSVMはクラス不均衡に対してより感受性を示した。

ABSTRACT

The authors compared oversampling methods for the problem of multi-class topic classification. The SMOTE algorithm underlies one of the most popular oversampling methods. It consists in choosing two examples of a minority class and generating a new example based on them. In the paper, the authors compared the basic SMOTE method with its two modifications (Borderline SMOTE and ADASYN) and random oversampling technique on the example of one of text classification tasks. The paper discusses the k-nearest neighbor algorithm, the support vector machine algorithm and three types of neural networks (feedforward network, long short-term memory (LSTM) and bidirectional LSTM). The authors combine these machine learning algorithms with different text representations and compared synthetic oversampling methods. In most cases, the use of oversampling techniques can significantly improve the quality of classification. The authors conclude that for this task, the quality of the KNN and SVM algorithms is more influenced by class imbalance than neural networks.

研究の動機と目的

  • クラス不均衡を緩和するための合成オーバーサンプリング手法の有効性を、多クラステキスト分類タスクにおいて評価すること。
  • KNN、SVM、フィードフォワードネットワーク、LSTM、バイディレクショナルLSTMといった多様な機械学習モデルに対するオーバーサンプリングの影響を比較すること。
  • Bag-of-Words、TF-IDF、Word2Vecといった異なるテキスト表現方法が、オーバーサンプリング手法とどのように相互作用するかを分析すること。
  • ディープラーニングモデルが、KNN や SVM といった伝統的モデルと比較して、クラス不均衡に対して感受性が低いかどうかを特定すること。

提案手法

  • 少数クラスのバランスをとるために、ランダムオーバーサンプリング、SMOTE、Borderline SMOTE、ADASYN の4つのオーバーサンプリング手法を適用した。
  • 各オーバーサンプリング手法を、KNN、SVM、フィードフォワードニューラルネットワーク(FNN)、LSTM、バイディレクショナルLSTM(BLSTM)の5つの分類アルゴリズムと組み合わせた。
  • 3種類のテキスト表現手法を用いた:Bag-of-Words、TF-IDF、Word2Vec(線形およびシーケンスベースの表現)。
  • オーバーサンプリングのk値として75%および100%を用い、標準指標(正解率、F1スコア、適合率、再現率)を用いてパフォーマンスを評価した。
  • クラス分布に偏りのある伝記テキスト分類データセットを用いて実験を実施した。
  • モデルおよび表現のオーバーサンプリングに対する感受性を評価するために、複数の構成で結果を報告した。

実験結果

リサーチクエスチョン

  • RQ1合成オーバーサンプリング手法(SMOTE、ADASYN、Borderline SMOTE、ランダムオーバーサンプリング)は、多クラステキスト分類における分類パフォーマンスにどのように影響を与えるか?
  • RQ2クラス不均衡の状況下で、どの機械学習モデル(KNN、SVM、FNN、LSTM、BLSTM)がオーバーサンプリングから最も利益を受けるか?
  • RQ3異なるテキスト表現(Bag-of-Words、TF-IDF、Word2Vec)は、パフォーマンス向上の観点から、オーバーサンプリング手法とどのように相互作用するか?
  • RQ4伝統的モデル(KNN、SVM)とディープニューラルネットワーク(LSTM、BLSTM)の間で、オーバーサンプリングによるパフォーマンス向上の程度に顕著な差が生じるか?
  • RQ5モデル、テキスト表現、オーバーサンプリング手法のどの組み合わせがマイノリティクラスのF1スコアと再現率を最も高めるか?

主な発見

  • ADASYNは、k=100%の条件下でWord2Vec(シーケンス)とBLSTMを組み合わせた際、F1スコア71.53%、再現率91.32%を達成し、他の手法を上回った。
  • SMOTEは、k=100%の条件下でTF-IDFとKNNを組み合わせた際、F1スコア70.79%、再現率90.08%を記録し、伝統的モデルにおいても優れたパフォーマンスを示した。
  • KNNおよびSVMはクラス不均衡に対して最も感受性が高く、オーバーサンプリングなしではF1スコアが60%未満に低下したが、ディープラーニングモデルはより高い耐性を示した。
  • BLSTMにADASYNを適用した場合、Word2Vec(シーケンス)でF1スコア83.91%、再現率85.19%を達成し、適応的オーバーサンプリングの恩恵を顕著に受けた。
  • ランダムオーバーサンプリングはすべてのモデルで一貫したパフォーマンス向上を示したが、特にマイノリティクラスのF1スコアおよび再現率において、SMOTEおよびADASYNに劣った。
  • Word2Vec(シーケンス)とADASYNの組み合わせが最も優れた全体的な結果をもたらし、k=100%のBLSTMで正解率82.28%、F1スコア78.16%を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。