[論文レビュー] Sampling Techniques in Bayesian Target Encoding
この論文では、固定されたモーメントの代わりに、ターゲット統計量の事後分布からサンプリングすることで、一般化性能を向上させるとともにターゲット漏れを低減する、新しいカテゴリカル変数エンコーディング手法「Sampling Bayesian Encoder」を提案する。合成データおよび実世界のデータセットにおいて、従来のターゲットエンコーディングおよびベイジアンターゲットエンコーディングを上回り、より高い精度とより良好な特徴量重要度のキャリブレーションを達成する。
Target encoding is an effective encoding technique of categorical variables and is often used in machine learning systems for processing tabular data sets with mixed numeric and categorical variables. Recently en enhanced version of this encoding technique was proposed by using conjugate Bayesian modeling. This paper presents a further development of Bayesian encoding method by using sampling techniques, which helps in extracting information from intra-category distribution of the target variable, improves generalization and reduces target leakage.
研究の動機と目的
- 従来のターゲットエンコーディングにおけるターゲット漏れと過学習を、ベイジアン推論を活用することで解消すること。
- カテゴリ内ターゲット分布の平均以外の情報を捉えることで、高基数のカテゴリカル変数における一般化性能を向上させること。
- モーメントに基づくベイジアンターゲットエンコーディングの代替として、理論的裏付けのあるサンプリングベースの手法を開発すること。
- ヒューリスティックなノイズ注入に依存することを減らし、サンプリングによるパラメータ空間の自然な探索を可能にすること。
- 多様な機械学習モデルを用いた合成および実世界のデータセット上で、本手法の実証的妥当性を検証すること。
提案手法
- 各カテゴリのターゲット変数の分布を共役事前分布でモデル化し、学習データで更新することで事後分布を取得する。
- 事後分布の最初の Q モーメントを用いるのではなく、事後分布からサンプリングしてエンコーディング表現を生成する。
- エンコーディング関数 f(θ) は、事後分布のパラメータを Q 次元空間にマップし、柔軟な表現学習を可能にする。
- 予測値は、K 個の事後分布サンプルにおけるモンテカルロ平均で推定される:ŷ(xₙ) ≈ (1/K)Σŷ_θ(ξₙ, f₁(θₙ₁ᵏ), ..., fₘ(θₙₘᵏ))。
- トレーニングおよび推論の両方で、1例あたり K 個のサンプルを用いてサンプリングを行い、実質的にデータセットサイズを K×N に拡大する。
- 本手法は任意の予測モデルと互換性があり、多項式やオイド(Weight of Evidence)など、f(θ) の選択によって柔軟な特徴工学が可能となる。
実験結果
リサーチクエスチョン
- RQ1ベイジアンターゲットエンコーディングにおいて、事後分布からのサンプリングは、固定されたモーメントを使用するのと比較して、より良い一般化性能をもたらすか?
- RQ2提案手法のサンプリングベースのアプローチは、標準的なターゲットエンコーディングおよびLeaveOneOutEncoderと比較して、ターゲット漏れを低減するか?
- RQ3サンプル数 K の値が、モデル性能およびトレーニング効率にどのように影響するか?
- RQ4マッピング関数 f(θ) の選択が、特に表現力に乏しいモデルにおいて、モデル性能にどの程度影響を与えるか?
- RQ5事前分布のスケーリング係数 γ が、希少カテゴリに対してモデルのロバストネスにどのように影響するか?
主な発見
- make_classification データセットでは、ランダムフォレストを用いた際、Sampling Bayesian Encoder が 0.6595 の精度を達成し、最良の LeaveOneOutEncoder モデル(0.6585)をわずかに上回った。
- make_hastie_10_2 データセットでは、本手法が 0.8229 の精度を達成したのに対し、LeaveOneOutEncoder のベースラインは 0.8217 であった。
- Adult データセットでは、本手法が 0.8652 の精度を達成したのに対し、最良の LeaveOneOutEncoder モデルは 0.8647 であった。
- メルセデス・ベンツ データセットでは、R² スコアが 0.61135 に達したのに対し、LeaveOneOutEncoder は 0.60974 であった。
- 特徴量重要度の分析から、Sampling Bayesian Encoder を使用したモデルは、カテゴリカル特徴量への重要度を著しく低く割り当てており、ターゲット漏れが低減していることが示された。
- コンペティション環境における公開および非公開テストセットでも、本手法はより優れた一般化性能を示し、未知のデータへの汎用性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。