Skip to main content
QUICK REVIEW

[論文レビュー] A benchmark of categorical encoders for binary classification

Federico Matteucci, Vadim Arzamasov|arXiv (Cornell University)|Jul 17, 2023
Machine Learning and Data ClassificationComputer Science被引用数 3
ひとこと要約

本稿は、二値分類のためのカテゴリカルエンコーダーに関する、これまでで最も包括的なベンチマークを提示している。50のデータセット、5つの機械学習モデル、4つの評価指標、3つのチューニング戦略、10種類の集約手法を含む、32のエンコーダー設定を評価した。その結果、エンコーダーのパフォーマンスは実験要因に極めて敏感であり、モデルの選択、評価指標、集約戦略によって順位が顕著に変化することが判明した。これは、範囲が狭い研究から得られた先行の結論に疑問を呈するものであり、エンコーダー評価における広範な実験設計の必要性を強調している。

ABSTRACT

Categorical encoders transform categorical features into numerical representations that are indispensable for a wide range of machine learning models. Existing encoder benchmark studies lack generalizability because of their limited choice of (1) encoders, (2) experimental factors, and (3) datasets. Additionally, inconsistencies arise from the adoption of varying aggregation strategies. This paper is the most comprehensive benchmark of categorical encoders to date, including an extensive evaluation of 32 configurations of encoders from diverse families, with 36 combinations of experimental factors, and on 50 datasets. The study shows the profound influence of dataset selection, experimental factors, and aggregation strategies on the benchmark's conclusions -- aspects disregarded in previous encoder benchmarks.

研究の動機と目的

  • 既存のカテゴリカルエンコーダーのベンチマークに一般化可能性の欠如があることに対処する。これは、しばしば限定的なデータセット、一貫性のない評価指標、明確でないチューニングまたは集約戦略を用いているためである。
  • 機械学習モデル、評価指標、チューニング戦略、集約手法といった実験要因がエンコーダーのパフォーマンス順位に与える影響を評価する。
  • 多様な実験設定において、特に決定木とロジスティック回帰に対して、最も堅牢なエンコーダー設定を特定・推奨する。
  • ρ-replicabilityとJ-replicabilityを用いて再現性を定量的に評価し、モデルやデータセットのサンプルによって結果が顕著に異なることを示す。
  • 今後の研究における再現可能で比較可能なエンコーダー評価を支援するため、公開可能なベンチマークフレームワークを提供する。

提案手法

  • 本研究では、多様な分野にまたがる50の二値分類データセットを用い、最先端および新規のエンコーダーを含む32のエンコーダー設定を評価した。
  • ロジスティック回帰、ランダムフォレスト、勾配ブースティング、k-NN、SVMの5つの広く使われている機械学習モデルを用い、3つの異なるチューニング戦略(チューニングなし、モデルチューニング、フルパイプラインチューニング)を適用した。
  • パフォーマンスの多面的評価を確保するため、ROC AUC、バランス精度、正解率、および精度再現率AUCの4つの評価指標を用いた。
  • Friedman-Nemenyi、Kemeny-Young、およびヒューリスティック順位付けを含む10種類の集約手法を適用し、コンSENSUS順位を導出し、後処理手法への感受性を評価した。
  • 再現性は、順位のスピアマン相関を示すρ-replicabilityと、上位k個のセットのジャカード類似度を示すJ-replicabilityを用いて定量的に評価し、実験条件間での一貫性を統計的に検証した。
  • すべての実験は標準化された前処理を経て実施され、コードは公開されており、再現性を確保するとともに、今後のベンチマーク作成を容易にしている。
Figure 1 : Sensitivity as the average similarity between rankings, measured with $\rho$ (upper triangle) and $J$ (lower triangle), computed between individual rankings for varying: (a) ML model, (b) quality metric, (c) tuning strategy, and between consensus rankings for varying (d) aggregation strat
Figure 1 : Sensitivity as the average similarity between rankings, measured with $\rho$ (upper triangle) and $J$ (lower triangle), computed between individual rankings for varying: (a) ML model, (b) quality metric, (c) tuning strategy, and between consensus rankings for varying (d) aggregation strat

実験結果

リサーチクエスチョン

  • RQ1機械学習モデル、評価指標、チューニング戦略、集約手法といった異なる実験要因が、カテゴリカルエンコーダーの順位にどのように影響を与えるか。
  • RQ2カテゴリカルエンコーダーのパフォーマンスは、異なるデータセットや実験設定においてどの程度再現可能か。
  • RQ3特に木構造モデルおよび線形モデルにおいて、どのエンコーダー設定が一貫して他のものよりも優れているか。
  • RQ4集約戦略はエンコーダーのコンセンサス順位にどのように影響を与え、ベンチマーク結果の解釈にどのような影響を及えるか。
  • RQ5先行研究が、最良のエンコーダーについて矛盾した結論を出しているのはなぜか。これは実験設計の違いによって説明可能か。

主な発見

  • エンコーダーのパフォーマンスは、機械学習モデルの選択に極めて敏感であり、ロジスティック回帰では再現性が最も高く(ρ-replicability)、決定木では最も低かった。
  • 決定木の文脈では、Weight of Evidenceが常に1位にランクされたが、統計的有意差は確認されなかった。
  • ロジスティック回帰では、Sum、One-Hot、Binary、およびWeight of Evidenceが他のエンコーダーよりも顕著に高い順位を達成しており、t検定により統計的有意性が確認された。
  • Min-hashおよびOne-Hotといった類似度エンコーダーは、有意水準0.05でt検定において有意差が認められず、以前の優位性に関する主張を裏付けるものではなかった。
  • Kemeny-YoungやFriedman-Nemenyiといった集約戦略は、顕著に異なるコンセンサス順位を導出し、後処理手法の影響がベンチマーク解釈に与える重要性を浮き彫りにした。
  • 再現性指標の結果から、より大きなデータセットのサンプルは信頼性を向上させるが、J-replicabilityについては一貫したトレンドが見られず、順位の一貫性に複雑な依存関係があることが示唆された。
Figure 2 : Replicability as the average similarity of consensus rankings from disjoint subsets of datasets.
Figure 2 : Replicability as the average similarity of consensus rankings from disjoint subsets of datasets.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。