Skip to main content
QUICK REVIEW

[論文レビュー] Similarity Based Stratified Splitting: an approach to train better classifiers

Felipe Farias, Teresa B. Ludermir|arXiv (Cornell University)|Oct 12, 2020
Text and Document Classification Technologies被引用数 10
ひとこと要約

本論文は、入力空間および出力空間の類似性を活用して、類似したサンプルを異なる訓練およびテストフォールドに分散させることで、分類器の性能を向上させる、新しいデータ分割手法である類似性ベースの階層的分割(SBSS)を提案する。22のデータセットと複数の分類器を用いた評価において、標準的な10分割交差検証と比較して75%のケースでテスト精度が著しく向上し、実世界のモデルの汎化性能を向上させる低コストで分類器に依存しない戦略であることが示された。

ABSTRACT

We propose a Similarity-Based Stratified Splitting (SBSS) technique, which uses both the output and input space information to split the data. The splits are generated using similarity functions among samples to place similar samples in different splits. This approach allows for a better representation of the data in the training phase. This strategy leads to a more realistic performance estimation when used in real-world applications. We evaluate our proposal in twenty-two benchmark datasets with classifiers such as Multi-Layer Perceptron, Support Vector Machine, Random Forest and K-Nearest Neighbors, and five similarity functions Cityblock, Chebyshev, Cosine, Correlation, and Euclidean. According to the Wilcoxon Sign-Rank test, our approach consistently outperformed ordinary stratified 10-fold cross-validation in 75\\% of the assessed scenarios.

研究の動機と目的

  • 従来のデータ分割手法が入力空間の類似性を考慮しないことが原因で、モデルの汎化性能が最適でないという限界を是正すること。
  • 訓練およびテストセットにおけるデータ分布のより良い表現を保証することで、モデル性能を向上させるデータ分割戦略の開発。
  • 学習アルゴリズムを変更せずに、モデルの汎化性能を向上させる分類器に依存しない低コストの手法の提案。
  • 統計的有意性の検定を用いて、多様なデータセットおよび分類器を用いたSBSSの有効性の評価。
  • 異なる類似性関数(例:ユークリッド、コサイン、相関)がSBSSにおけるモデル性能に与える影響の調査。

提案手法

  • SBSSは、入力空間におけるサンプル間のペアワイズ距離を測定する類似性関数を用いる。この際、入力特徴量と出力ラベルの両方を考慮する。
  • サンプルは類似度に基づいてクラスタにグループ化され、同じフォールド内での類似度を最小限に抑えるように分割されるが、クラス分布を維持する。
  • 階層的分割を適用してフォールド間でのクラス比を保つとともに、類似性制約を強化することで、訓練データ内の冗長性を低減する。
  • モデル性能に与える影響を評価するため、5つの類似性関数(マンハッタン、チエビシェフ、コサイン、相関、ユークリッド)を評価した。
  • アルゴリズムは、類似したサンプルが異なるフォールドに配置されるように保証し、トレーニング中の多様性を高め、より良い汎化を促進する。
  • SBSSは10分割交差検証フレームワークに適用され、標準的な階層的10分割交差検証と比較して、ウィルコクソン符号順位検定を用いて性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1入力空間の類似性をデータ分割に組み込むことで、標準的な階層的分割と比較して分類器の汎化性能が向上するか?
  • RQ2類似性関数の選択(例:ユークリッド、コサイン、相関)がSBSSの性能向上に与える影響は何か?
  • RQ3SBSSは多様なデータセットおよび分類器タイプにおいて一貫してモデル性能を向上させることができるか?
  • RQ4SBSSの性能向上は、複数のベンチマークデータセットにおいて統計的に有意であるか?
  • RQ5SBSSは、データ分布をよりよく再現することで、過学習を低減し、実世界の性能推定を改善できるか?

主な発見

  • SBSSは、評価されたシナリオの75%で標準的な10分割交差検証を著しく上回り、ウィルコクソン符号順位検定により統計的有意性が確認された。
  • 22のデータセットと4つの分類器(MLP、SVM、KNN、RF)を用いた合計440回の比較のうち、330回(75%)でテスト精度が向上した。
  • SVM分類器において相関類似性を用いた場合、SBSSは標準的な10分割交差検証と比較して平均で1.121%の精度向上を達成し、統計的検定で16勝0敗を記録した。
  • 全データセットおよび分類器全体での平均精度向上は、訓練セットで0.428%、テストセットで1.547%であり、ウィルコクソン検定の結果は1L/12T/9Wとなった。
  • SBSSは、高次元データセット(例:'vowel'、'madelon')および不均衡データセット(例:'credit-g'、'diabetes')を含む多様なデータセットで一貫した改善を示した。
  • この手法は分類器に依存せず、最小限の計算コストで実現可能であるため、学術的および産業的な機械学習パイプラインへの導入に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。