[論文レビュー] Encoding categorical data: Is there yet anything 'hotter' than one-hot encoding?
本研究は、線形混合効果モデルを用いて大規模な OpenML データセットコレクションを横断的に評価し、マルチクラス課題では one-hot および Helmert コーディングがターゲットベースのエンコーダより優れている一方、二値課題では差は控えめであることを示している。
Categorical features are present in about 40% of real world problems, highlighting the crucial role of encoding as a preprocessing component. Some recent studies have reported benefits of the various target-based encoders over classical target-agnostic approaches. However, these claims are not supported by any statistical analysis, and are based on a single dataset or a very small and heterogeneous sample of datasets. The present study explores the encoding effects in an exhaustive sample of classification problems from OpenML repository. We fitted linear mixed-effects models to the experimental data, treating task ID as a random effect, and the encoding scheme and the various characteristics of categorical features as fixed effects. We found that in multiclass tasks, one-hot encoding and Helmert contrast coding outperform target-based encoders. In binary tasks, there were no significant differences across the encoding schemes; however, one-hot encoding demonstrated a marginally positive effect on the outcome. Importantly, we found no significant interactions between the encoding schemes and the characteristics of categorical features. This suggests that our findings are generalizable to a wide variety of problems across domains.
研究の動機と目的
- 広範かつ全件サンプリングされた分類問題のセットにおいて、エンコーディングタイプが予測性能に与える影響を評価する。
- 実世界データセットにおいて、ターゲットベースのエンコーダがターゲット非依存エンコーダより有利かどうかを判断する。
- エンコーディングの選択が学習/推論の効率性およびモデルベースの特徴量重要度に影響を与えるかを評価する。
- エンコーディング方式とデータセット特性(カテゴリ特徴の出現頻度、基数など)との相互作用を調べる。
- 二値および多クラスの課題を跨いだエンコーディング効果の一般化可能性を検討する。
提案手法
- 二値および多クラス分類タスクの網羅的な OpenML データセットコレクションを作成した。
- すべてのカテゴリ特徴に対して、5つのエンコーダ(ラベル、one-hot、Helmert、ターゲット、ウェイト・オブ・エビデンス)を適用した。
- 各エンコード済みデータセット上で、H2O AutoML を用いて複数の基礎モデルとスタックドアンサンブルを訓練した。
- タスクIDをランダム効果、エンコーディングタイプと特徴量特性を固定効果とする線形混合効果モデルを適合させた。
- 線形モデルと非線形モデル(GLM と XGBoost)および二値 vs 多クラス課題間で性能を比較した。
実験結果
リサーチクエスチョン
- RQ1エンコーディングタイプは、二値および多クラス課題を跨るヘテロジニアス・アンサンブル(スタックド・アンサンブル)の予測力に影響を与えるか?
- RQ2エンコーディングタイプは個々の基底推定器(線形 vs 非線形)の予測力に影響を与えるか?
- RQ3異なるデータセット特性に対して、エンコーディング方式が学習時間と効率にどのように影響するか?
- RQ4性能決定において、エンコーディング方式とカテゴリ特徴の特徴量の相互作用はあるか?
- RQ5OpenML の多様な実世界の分類問題に対して、結果は一般化可能か?
主な発見
- 二値タスクでは、カテゴリ特徴の割合が多いほどアンサンブルの性能に負の影響を与え、平均基数が高いと性能が改善されることもある。一方で、基数が高いと性能を損なうことがある。
- マルチクラス課題では、ターゲットクラスの数が性能の主要決定因子であり、スタックド・アンサンブルに対して OHE および Helmert エンコーディングがターゲットベースのエンコーダより改善を示すことがある。
- 線形モデルでは、ラベルエンコーディングは二値タスクで予測力を低下させる傾向があり、マルチクラス課題ではターゲットベース/インジケータエンコーディングが一般にラベルエンコーディングより優れている。
- モデルを通じて、エンコーディングタイプは二値タスクのアンサンブル性能に限定的または有意な影響をほとんど与えず、マルチクラスの GLM/XGBoost の結果では OHE および Helmert の利益が観察された。
- ターゲットベースのエンコーダと OHE は、特定のマルチクラスの状況でラベルエンコーディングより有利になることがあるが、結果はモデルタイプによって異なる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。