Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Hybrid Oversampling and Intelligent Undersampling for Imbalanced Big Data Classification

Carla Vairetti, José Luis Assadi|arXiv (Cornell University)|Oct 9, 2023
Imbalanced Data Classification TechniquesComputer Science被引用数 3
ひとこと要約

本稿では、大規模な不均衡データに対して、1回のMapReduceパスで知的なアンダーサンプリング(ENN)とオーバーサンプリング(SMOTE)を統合する新しいハイブリッドリサンプリング手法SMOTENNを提案する。この手法は、計算効率と性能の両面で顕著な向上を実現し、独立して実行されたSMOTEとENNと比較して、実行時間の最大72.9%の短縮を達成した。小・中・大規模なデータセットにおいて、g-meanの観点でベースライン手法を上回り、境界領域のノイズ低減効果も顕著であった。

ABSTRACT

Imbalanced classification is a well-known challenge faced by many real-world applications. This issue occurs when the distribution of the target variable is skewed, leading to a prediction bias toward the majority class. With the arrival of the Big Data era, there is a pressing need for efficient solutions to solve this problem. In this work, we present a novel resampling method called SMOTENN that combines intelligent undersampling and oversampling using a MapReduce framework. Both procedures are performed on the same pass over the data, conferring efficiency to the technique. The SMOTENN method is complemented with an efficient implementation of the neighborhoods related to the minority samples. Our experimental results show the virtues of this approach, outperforming alternative resampling techniques for small- and medium-sized datasets while achieving positive results on large datasets with reduced running times.

研究の動機と目的

  • 大規模な機械学習データセットにおけるクラス不均衡の課題に対処すること。従来のリサンプリング手法は、計算的に非現実的になる場合がある。
  • 本研究では、初めてのハイブリッドアンダーサンプリング・オーバーサンプリング手法として、SMOTEとENNを1回のパスで統合した手法を提案し、文献におけるギャップを埋めることを目的とする。
  • スケーラブルなMapReduceフレームワーク上で、近隣計算、合成サンプル生成、多数クラスサンプルの削除を同時に実行することで、計算効率を向上させること。
  • 特に実行時間とモデル性能の観点から、大規模データ環境下におけるオーバーサンプリングとアンダーサンプリングのトレードオフを実証的に評価すること。
  • 多様なデータセットサイズや不均衡比にわたり、高い性能を維持する、頑健でデフォルト設定可能な手法を提供すること。

提案手法

  • SMOTENNは、少数クラスの各インスタンスに対して1つのk近傍を定義し、1回のデータ走査でENNとSMOTEを同時に適用可能にする。
  • 少数クラスの各サンプルについて、そのk個の近隣を特定し、近隣に多数クラスのインスタンスが過半を占める場合にENNNを適用して削除する。
  • 同時に、SMOTEの標準的な補間式を用いて、少数クラスインスタンスとそのk近隣との間で線形補間により合成少数サンプルを生成する。
  • 全プロセスはMapReduceフレームワークを用いて並列化され、スケーラブルな分散距離関数により距離計算が最適化されている。
  • さらに、SMOTENN処理の前処理としてランダムアンダーサンプリング(RUS)を統合し、データ量を事前に削減することで性能を向上させている。
  • 実装は、Amazon EC2上のSpark 2.4.8を用い、m5.xlargeおよびc5.5xlargeインスタンスを活用することで、大規模データセットに対しても高いスケーラビリティを確保している。

実験結果

リサーチクエスチョン

  • RQ1大規模データ上で効率的に動作する、知的なアンダーサンプリングとオーバーサンプリングを統合したハイブリッドリサンプリング手法を1回のパスで設計可能か?
  • RQ2データセットサイズが増加するに従い、SMOTENNの計算効率は独立して実行されたSMOTEとENNと比較してどの程度優れているか?
  • RQ3提案手法は、単独のSMOTE、ENN、RUS、またはそれらの組み合わせと比較して、不均衡な大規模データにおいてg-meanの観点で優れた分類性能を達成するか?
  • RQ4他のリサンプリング手法と比較して、SMOTENNは境界領域におけるノイズ低減効果をどの程度実現するか?
  • RQ5多様なデータセットに対して一貫して高い性能を発揮する、ハイパーパrameterチューニングをほとんど必要としないデフォルト設定のSMOTENNが存在するか?

主な発見

  • SMOTENNは、独立して実行されたSMOTEとENNの合計時間の平均38.8%の実行時間で、最良ケースでは20.4%、最悪ケースでは72.9%まで短縮した。
  • 最大のデータセット(lds5)では、SMOTENNは551.8秒で実行され、ENN単体の339.3秒よりも17倍速く、ENNN+SMOTEの合計757.1秒よりも顕著に高速であった。
  • 小規模および中規模のデータセットでは、g-meanの観点で、すべてのベースライン手法を上回り、優れた分類性能を示した。
  • 異なる不均衡比や特徴量数に対しても、顕著なハイパーパrameterチューニングなしで、安定した性能を維持した。
  • 効率性の高さにもかかわらず、RUSはすべてのデータセットで4秒未満で実行され、最も高速であった。これは、速度とノイズ低減のトレードオフを示している。
  • 結果から、合成オーバーサンプリングは小規模データセットでは有益であるが、非常に大きなデータセット(例:数百万サンプル)ではその価値が低下し、RUSで十分である可能性があると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。