Skip to main content
QUICK REVIEW

[論文レビュー] OpenFE: Automated Feature Generation with Expert-level Performance

Tianping Zhang, Zheyu Zhang|arXiv (Cornell University)|Nov 22, 2022
Machine Learning and Data Classification被引用数 7
ひとこと要約

OpenFE は、候補特徴量の効率的で逐次的な評価に FeatureBoost を使用し、スケーラブルな特徴選択のための二段階の pruning 戦略を採用することで、熟練した人間の水準のパフォーマンスを達成する自動特徴工学フレームワークである。Kaggle コンペティションにおいて、OpenFE を適用したモデルはそれぞれ 99.3% および 99.6% のチームを上回り、人為的介入を最小限に抑えてテーブルデータで最先端の結果を達成した。

ABSTRACT

The goal of automated feature generation is to liberate machine learning experts from the laborious task of manual feature generation, which is crucial for improving the learning performance of tabular data. The major challenge in automated feature generation is to efficiently and accurately identify effective features from a vast pool of candidate features. In this paper, we present OpenFE, an automated feature generation tool that provides competitive results against machine learning experts. OpenFE achieves high efficiency and accuracy with two components: 1) a novel feature boosting method for accurately evaluating the incremental performance of candidate features and 2) a two-stage pruning algorithm that performs feature pruning in a coarse-to-fine manner. Extensive experiments on ten benchmark datasets show that OpenFE outperforms existing baseline methods by a large margin. We further evaluate OpenFE in two Kaggle competitions with thousands of data science teams participating. In the two competitions, features generated by OpenFE with a simple baseline model can beat 99.3% and 99.6% data science teams respectively. In addition to the empirical results, we provide a theoretical perspective to show that feature generation can be beneficial in a simple yet representative setting. The code is available at https://github.com/ZhangTP1996/OpenFE.

研究の動機と目的

  • テーブル機械学習における手作業による特徴工学の高い計算コストと非効率性に対処すること。
  • 広範なドメイン知識を必要とせず、熟練した人間の水準のパフォーマンスに匹敵またはそれを上回る自動特徴生成を可能にすること。
  • 大規模なテーブルデータセットにおける数百万個の候補特徴量の評価におけるスケーラビリティのボトルネックを克服すること。
  • 一貫した条件下で既存手法を再実装・評価することで、公平で再現可能なかんばんを提供すること。
  • 深層学習の時代でさえも特徴生成の価値を、実証的および理論的に検証すること。

提案手法

  • FeatureBoost: 基本的な特徴セットからのモデル予測を用いて、新しい特徴量を段階的に評価する勾配ブースティングに類似した手法であり、完全な再トレーニングを回避する。
  • 二段階の pruning: スケールで無効な特徴量を事前にフィルタリングする粗い段階から、その後に高パフォーマンスの特徴量を特定する細かい段階へと進む戦略。
  • 拡張・縮小フレームワーク: 変換操作(例:GroupByThenMean)を用いて候補特徴量を生成し、パフォーマンスに基づくフィルタリングによってそれを縮小する。
  • 効率的な評価: モデルの完全な再トレーニングではなく、モデル出力に対する段階的トレーニングを用いることで、計算コストを桁違いに削減する。
  • スケーラブルな特徴空間探索: 組み合わせ的爆発を管理するため、ヒューリスティックおよび統計的 pruning を採用する。
  • 深層学習モデルとの統合: 最先端の DNN における特徴量の影響を評価することで、従来のモデルにとどまらない汎用性を示す。

実験結果

リサーチクエスチョン

  • RQ1自動特徴生成は熟練した人間による特徴工学と同等のパフォーマンスを達成できるか?
  • RQ2完全なモデル再トレーニングなしで、新しい特徴量の逐次的価値を評価することは可能か?
  • RQ3数百万個の候補特徴量を効率的にプルーニングし、最も効果的なものを特定するにはどうすればよいか?
  • RQ4高度な深層ニューラルネットワークを用いる場合でも、特徴生成は依然として利点を提供するか?
  • RQ5代表的な機械学習設定における特徴生成の実証的および理論的影響は何か?

主な発見

  • OpenFE は 10 個のベンチマークデータセットすべてでベースライン手法を上回り、AUC および正答率の両面で統計的に有意な改善を示した。
  • 2 つの主要な Kaggle コンペティションにおいて、OpenFE を適用したモデルはそれぞれ 99.3% および 99.6% の参加チームを上回った。
  • OpenFE が生成した特徴量は、Kaggle コンペティションの優勝チームが作成した特徴量と同等またはそれ以上のパフォーマンスを達成した。
  • FeatureBoost の手法により、完全な再トレーニングと比較して評価時間を 90% 以上短縮でき、スケーラブルな特徴探索を可能にした。
  • 二段階の pruning 戦略により、無効な特徴量を早期にフィルタリングすることで、メモリおよび計算コストを削減し、スケーラビリティを向上させた。
  • 実証的結果から、最先端の深層ニューラルネットワークを用いたテーブルデータの文脈でも、特徴生成が依然としてパフォーマンス向上に寄与することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。