Skip to main content
QUICK REVIEW

[論文レビュー] RankML: a Meta Learning-Based Approach for Pre-Ranking Machine Learning Pipelines

Doron Laadan, Roman Vainshtein|arXiv (Cornell University)|Oct 31, 2019
Machine Learning and Data Classification参考文献 25被引用数 6
ひとこと要約

RankML は、実行せずに機械学習パイプラインを予測・順位付けするメタラーニング手法であり、過去のデータセットとパイプライントポロジから得られるメタ特徴量を用いる。244のデータセットにおいて最先端の性能を達成し、ほぼ即時の推論(O(1)の複雑さ)を実現。TPOT や auto-sklearn といった計算コストの高いベースラインを上回るか同等の性能を発揮しながら、実行時間を数秒から数時間のレベルに短縮する。

ABSTRACT

The explosion of digital data has created multiple opportunities for organizations and individuals to leverage machine learning (ML) to transform the way they operate. However, the shortage of experts in the field of machine learning -- data scientists -- is often a setback to the use of ML. In an attempt to alleviate this shortage, multiple approaches for the automation of machine learning have been proposed in recent years. While these approaches are effective, they often require a great deal of time and computing resources. In this study, we propose RankML, a meta-learning based approach for predicting the performance of whole machine learning pipelines. Given a previously-unseen dataset, a performance metric, and a set of candidate pipelines, RankML immediately produces a ranked list of all pipelines based on their predicted performance. Extensive evaluation on 244 datasets, both in regression and classification tasks, shows that our approach either outperforms or is comparable to state-of-the-art, computationally heavy approaches while requiring a fraction of the time and computational cost.

研究の動機と目的

  • 自動機械学習(AutoML)パイプライン生成における高い計算コストと長いトレーニング時間の問題を解決すること。
  • 以前に分析されたデータセットとパイプラインからのメタ知識を活用することで、高価なパイプライン評価に依存するのを減らすこと。
  • データのメタ特徴量とパイプライン構造の両方を用いて、新しいデータセット向けに高速かつスケーラブルなパイプライン事前順位付けを可能にすること。
  • 多様な分類および回帰タスクにおけるパイプラインパフォーマンスに関する公開データセットを構築すること。
  • メタラーニングが、ターゲットデータセットでの再評価なしにパイプラインパフォーマンスを効果的に予測できるかどうかを示すこと。

提案手法

  • RankML は、データセット(例:統計的性質、クラス分布)およびパイプライントポロジ(例:プリミティブの順序、モデルタイプ)からメタ特徴量を構築する。
  • 大規模な過去のパイプラインパフォーマンス結果のデータセットを用いてトレーニングするメタラーニングフレームワークを採用する。
  • データレベルとパイプラインレベルの両方のメタ特徴量を組み合わせ、データ特性とパイプラインアーキテクチャの相互作用をモデル化する。
  • パイプラインの実行を一切行わず、予測されたパフォーマンス指標(例:正解率、MSE)に基づいて候補パイプラインの順位付けリストを生成する。
  • 244のデータセットと100以上のパイプラインを含む知識ベースを活用し、多様な機械学習タスクに一般化できる。
  • 推論時間がほぼ O(1) に抑えられ、リアルタイムでの事前順位付けが可能である。

実験結果

リサーチクエスチョン

  • RQ1実行せずにパイプライン全体のパフォーマンスを予測するためにメタラーニングを用いることは可能か?
  • RQ2データセットのメタ特徴量とパイプライントポロジの組み合わせ表現は、パイプライン順位付けの予測にどの程度効果的か?
  • RQ3計算コストを著しく削減しながら、最先端の AutoML フレームワークと同等またはそれを上回る予測精度を達成できるか?
  • RQ4上位順位のパイプラインを評価する数が増えるにつれて、RankML のパフォーマンスはどのように変化するか?
  • RQ5トレーニング時に見られなかった特性を持つデータセットに対しても、RankML はどの程度一般化できるか?

主な発見

  • 分類タスクにおいて、上位順位のパイプラインを検討した場合、RankML は TPOT や auto-sklearn と同等または優れた(BOC: better-or-comparable)性能を 39% のデータセットで達成した。
  • 回帰タスクでは、上位10個のパイプラインを評価した場合、RankML は 57% のデータセットで BOC のパフォーマンスを達成し、計算量を最小限に抑えながらベースラインを同等または上回った。
  • 回帰タスクでは平均で1分、分類タスクでは3分で RankML が処理を完了したが、TPOT はそれぞれ53分と115分を要した。
  • Friedman検定により、95%信頼水準で RankML のパフォーマンスはベースラインと統計的に差がないことが確認された。
  • 回帰タスクにおいて、K ≥ 8 の場合、RankML は auto-sklearn(E) のパフォーマンスと一致した。つまり、8個のパイプラインを評価するだけで同等の結果が得られた。
  • RankML が推薦する上位順位のパイプラインは多様であり、MaxAbsScaler(16%)と StandardScaler(11%)が最も頻繁に使用された前処理プリミティブであった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。