Skip to main content
QUICK REVIEW

[論文レビュー] A Comparison of Machine Learning Methods for Data with High-Cardinality Categorical Variables

Fabio Sigrist|arXiv (Cornell University)|Jul 5, 2023
Forecasting Techniques and ApplicationsDecision Sciences被引用数 3
ひとこと要約

この論文は、高次数のカテゴリカル変数を含む表形式データに対する機械学習手法を比較し、木ベースのアンサンブル手法、深層ニューラルネットワーク、およびランダム効果を含む線形混合効果モデルを評価している。ランダム効果を組み込んだモデルは予測精度を著しく向上させ、複数のデータセットにおいて、ランダム効果を含む木ベースのアンサンブル手法が、ランダム効果を含む深層ニューラルネットワークを上回ることを明らかにした。

ABSTRACT

High-cardinality categorical variables are variables for which the number of different levels is large relative to the sample size of a data set, or in other words, there are few data points per level. Machine learning methods can have difficulties with high-cardinality variables. In this article, we empirically compare several versions of two of the most successful machine learning methods, tree-boosting and deep neural networks, and linear mixed effects models using multiple tabular data sets with high-cardinality categorical variables. We find that, first, machine learning models with random effects have higher prediction accuracy than their classical counterparts without random effects, and, second, tree-boosting with random effects outperforms deep neural networks with random effects.

研究の動機と目的

  • 高次数のカテゴリカル変数を含む表形式データセットにおける機械学習モデルの性能を評価すること。
  • このようなデータに対してランダム効果を組み込むことで予測精度が向上するかを調査すること。
  • 予測性能と計算効率の観点から、木ベースのアンサンブル手法、深層ニューラルネットワーク、線形混合効果モデルを比較すること。
  • 異なるエンコーディング戦略(例:ワンホット、埋め込み、数値マッピング)がモデル性能に与える影響を評価すること。
  • 高次数の設定において、ランダム効果が効果的な正則化因子として機能するかを特定すること。

提案手法

  • 実世界の表形式データセットを用いて、木ベースのアンサンブル手法(LightGBM、CatBoost、GPBoost)、エンティティ埋め込みを用いた深層ニューラルネットワーク、線形混合効果モデルの複数のバリエーションを実験的に比較する。
  • 高次数のカテゴリカル変数の各水準をランダム効果として扱い、木ベースのアンサンブル手法および深層ニューラルネットワークにおいてグループレベルの変動をモデル化する。
  • 混合効果モデルを適用し、応答変数の平均を固定効果とランダム効果の和としてモデル化し、ランダム効果は学習された分散を持つ正規分布から抽出される。
  • 深層ニューラルネットワークでは、密層とランダム効果(LMMNN)を組み合わせたハイブリッドアーキテクチャを用い、グループレベルのパターンを捉える。
  • 木ベースのアンサンブル手法では、LightGBMとCatBoostがカテゴリカル変数をネイティブでサポートする機能を活用し、数値エンコーディングとの比較も行う。
  • 平均二乗誤差(MSE)を用いてモデルを評価し、最良の手法との平均相対差を報告するとともに、データセット全体での平均順位を算出する。
Figure 1: Average relative difference (in %) to the lowest test MSE. The Wages data set is not included for calculating this since not all methods were run on it.
Figure 1: Average relative difference (in %) to the lowest test MSE. The Wages data set is not included for calculating this since not all methods were run on it.

実験結果

リサーチクエスチョン

  • RQ1機械学習モデルにランダム効果を組み込むことで、高次数のカテゴリカル変数における予測精度が向上するか?
  • RQ2ランダム効果を含む木ベースのアンサンブル手法と、ランダム効果を含む深層ニューラルネットワークの間で、予測性能に差異は生じるか?
  • RQ3異なるエンコーディング戦略(例:ワンホット、埋め込み、数値マッピング)が、高次数のカテゴリカル変数におけるモデル性能に与える影響は何か?
  • RQ4線形混合効果モデルは、この文脈で古典的な独立モデルを上回る性能を示すか?
  • RQ5高次数のカテゴリカル変数を扱う際、木ベースのアンサンブル手法が深層ニューラルネットワークを一貫して上回る性能を発揮するか?

主な発見

  • ランダム効果を含む機械学習モデルは、古典的でランダム効果を含まないモデルよりも顕著に高い予測精度を達成する。
  • ランダム効果を含む木ベースのアンサンブル手法は、ランダム効果を含む深層ニューラルネットワークを上回り、LMMNNと比較して平均相対差が17.3%、LightGBM(Cat)と比較して17.4%である一方、LightGBM(Num)は111%、埋め込みを用いたニューラルネットワークは189%であった。
  • 全体で最も性能の優れた手法は、ランダム効果を含むGPBoostであり、平均相対差は9.63%、平均順位は2.43であった。
  • 線形混合効果モデルは最も性能が低く、平均相対差は47.7%、平均順位は5.71であった。
  • CatBoostとLightGBMは、ネイティブなカテゴリカル変数サポートを備えたバージョンが、数値エンコーディング版よりも優れた性能を示し、LightGBM(Cat)は平均順位3.29を達成した。
  • ウォールクロック時間には顕著な差が見られたが、ニューラルネットワークとLMMNNはGPUで実行された一方、他のモデルはCPUで実行されたが、性能差と実行時間の間に明確な相関は認められなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。