Skip to main content
QUICK REVIEW

[論文レビュー] An Extensive Evaluation of Filtering Misclassified Instances in Supervised Classification Tasks

Michael R. Smith, Tony Martinez|arXiv (Cornell University)|Dec 13, 2013
Machine Learning and Data Classification参考文献 27被引用数 9
ひとこと要約

本論文は、人工的なノイズを追加せずに、教師あり分類における誤分類インスタンスのフィルタリングを評価し、54のデータセットを対象に9つの学習アルゴリズムをフィルタとして比較した。エントリーブフィルタリングは正確性を顕著に向上させるが、メジャリティ投票アンサンブルは、ノイズに強いという内在的特性により、フィルタリングを上回る。特にノイズの多いデータでは、フィルタリングは最適でないことが判明した。

ABSTRACT

Removing or filtering outliers and mislabeled instances prior to training a learning algorithm has been shown to increase classification accuracy. A popular approach for handling outliers and mislabeled instances is to remove any instance that is misclassified by a learning algorithm. However, an examination of which learning algorithms to use for filtering as well as their effects on multiple learning algorithms over a large set of data sets has not been done. Previous work has generally been limited due to the large computational requirements to run such an experiment, and, thus, the examination has generally been limited to learning algorithms that are computationally inexpensive and using a small number of data sets. In this paper, we examine 9 learning algorithms as filtering algorithms as well as examining the effects of filtering in the 9 chosen learning algorithms on a set of 54 data sets. In addition to using each learning algorithm individually as a filter, we also use the set of learning algorithms as an ensemble filter and use an adaptive algorithm that selects a subset of the learning algorithms for filtering for a specific task and learning algorithm. We find that for most cases, using an ensemble of learning algorithms for filtering produces the greatest increase in classification accuracy. We also compare filtering with a majority voting ensemble. The voting ensemble significantly outperforms filtering unless there are high amounts of noise present in the data set. Additionally, we find that a majority voting ensemble is robust to noise as filtering with a voting ensemble does not increase the classification accuracy of the voting ensemble.

研究の動機と目的

  • 人工的にノイズを追加せずに、現実世界の inherently noisy データセットにおける誤分類インスタンスのフィルタリングが与える影響を評価すること。
  • どの学習アルゴリズムがフィルタとして最も効果的か、およびアンサンブルフィルタリングが分類正確性を向上させるかを特定すること。
  • ラベルノイズに対処する際、フィルタリングとメジャリティ投票アンサンブルの性能を比較すること。
  • データセットの特徴に基づく適応的フィルタリングまたはルールベース選択が、結果を改善するかを調査すること。

提案手法

  • C4.5、ランダムフォレスト、Ridor など9つの多様な学習アルゴリズム(C4.5, random forest, Ridor, etc.)を個々のフィルタとして評価し、学習の前に誤分類インスタンスを削除した。
  • すべての9つのアルゴリズムの予測を組み合わせて誤分類インスタンスを特定・削除する、アンサンブルフィルタリングを適用した。
  • データセットとターゲットアルゴリズムに応じて、9つの学習アルゴリズムのサブセットを選択する適応的フィルタリングアルゴリズムを開発した。
  • 9つの多様なベース分類器を用いたメジャリティ投票アンサンブルを訓練し、フィルタリング済みデータと未フィルタリングデータの性能を比較した。
  • 分類正確性の比較に、統計的有意性検定(p値)を用いた。
  • 元の正確性(例:90%未満、80%未満など)に基づいてデータセットをサブセットに分割し、ノイズレベルの異なる状況での性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1人工的にノイズを追加せずに、現実世界のデータセットにおける誤分類インスタンスのフィルタリングが分類正確性を向上させるか?
  • RQ2どの学習アルゴリズムがフィルタとして最も効果的か?また、フィルタリングと学習に同じアルゴリズムを使用すると性能が向上するか?
  • RQ3多様な学習アルゴリズムを対象に、アンサンブルフィルタリングは個々のフィルタリングや適応的フィルタリングを上回るか?
  • RQ4ラベルノイズに対する耐性という観点から、メジャリティ投票アンサンブルとフィルタリングの性能はどのように比較できるか?
  • RQ5フィルタリングは多様な投票アンサンブルの性能を劣化させるか?その理由は何か?

主な発見

  • アンサンブルフィルタリングは、すべての9つの学習アルゴリズムにおいて分類正確性を顕著に向上させ、個々のフィルタリングや適応的フィルタリングを上回った。
  • 高い内在的ノイズを有するデータセット(例:10%以上の誤ラベルインスタンス)では、アンサンブルフィルタリングが一部のアルゴリズムでメジャリティ投票アンサンブルを上回る正確性を達成したが、投票アンサンブルも依然として高い性能を示した。
  • 未フィルタリングデータで学習したメジャリティ投票アンサンブルは、フィルタリング済みデータで学習したものよりも顕著に高い平均正確性(83.62%)を達成したのに対し、後者は82.09%にとどまった。これは、フィルタリングがアンサンブルの多様性を損なうことを示している。
  • フィルタリングは、投票アンサンブル内のベースモデルの多様性を低下させ、一般化性能を弱め、未フィルタリング学習に比べて性能が低下した。
  • 投票アンサンブルはノイズに強く、未フィルタリングデータで学習したすべての個々の学習アルゴリズムを上回った。特に、元の正確性が低い(難しい)データセットでは顕著であった。
  • データセットの特徴に基づくルールベースのフィルタリング戦略は有効ではなかった。また、学習に使用したアルゴリズムと同じものをフィルタリングに用いることは、正確性の向上に効果がなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。