Skip to main content
QUICK REVIEW

[論文レビュー] Amazon SageMaker Autopilot: a white box AutoML solution at scale

Piali Das, Valerio Perrone|arXiv (Cornell University)|Dec 15, 2020
Machine Learning and Data Classification参考文献 32被引用数 7
ひとこと要約

Amazon SageMaker Autopilot は、表形式データ向けに多様な機械学習パイプラインを自動生成・最適化するスケーラブルで白箱型の AutoML システムであり、データサイエンティストがモデルを検査・変更可能にしながらも生産環境適合性を維持できる。XGBoost のデフォルト設定を上回り、最先端のベースラインと同等の性能を発揮するが、トレーニングが高速で遅延が低く、編集可能なコードと拡張可能な前処理コンponentを介してカスタマイズが可能である。

ABSTRACT

AutoML systems provide a black-box solution to machine learning problems by selecting the right way of processing features, choosing an algorithm and tuning the hyperparameters of the entire pipeline. Although these systems perform well on many datasets, there is still a non-negligible number of datasets for which the one-shot solution produced by each particular system would provide sub-par performance. In this paper, we present Amazon SageMaker Autopilot: a fully managed system providing an automated ML solution that can be modified when needed. Given a tabular dataset and the target column name, Autopilot identifies the problem type, analyzes the data and produces a diverse set of complete ML pipelines including feature preprocessing and ML algorithms, which are tuned to generate a leaderboard of candidate models. In the scenario where the performance is not satisfactory, a data scientist is able to view and edit the proposed ML pipelines in order to infuse their expertise and business knowledge without having to revert to a fully manual solution. This paper describes the different components of Autopilot, emphasizing the infrastructure choices that allow scalability, high quality models, editable ML pipelines, consumption of artifacts of offline meta-learning, and a convenient integration with the entire SageMaker suite allowing these trained models to be used in a production setting.

研究の動機と目的

  • ブラックボックス型 AutoML システムの限界を克服し、表形式データ向けに透明性がありカスタマイズ可能で生産環境適合性のあるソリューションを提供すること。
  • 特徴量工学、アルゴリズム選定、ハイパーパramータチューニングに要する人的作業を削減しながらも、高いモデル性能を維持すること。
  • 熟練ユーザーが完全に手動開発に戻ることなく、自動生成されたパイプラインを変更・拡張できることを可能にすること。
  • 時系列データや自然言語特徴量を含む多様なデータセットや複雑なデータタイプに対応できるようにシステムをスケーリングすること。
  • AWS SageMaker エコシステム全体とシームレスに統合され、デプロイメントおよび推論が可能になること。

提案手法

  • システムは、欠損値、歪度、相関関係、パフォーマンス予測のためのランドマーク特徴量を含む、入力データセットからの包括的なメタ特徴量を抽出する。
  • 専門家のヒューリスティクスと限定的なトレーニングデータに従うメタラーニングモデルが、データセットの特徴に応じて適切な前処理およびアルゴリズムパイプラインを選択する。
  • 特徴量工学、トレーニング、ポストプロセッシング段階を分離する分散型でコンテナ化されたアーキテクチャを用いて、複数の多様なパイプラインを並列に最適化する。
  • 相対誤差差分、ジョブ成功確率、100行のバッチに対する推論遅延といった標準化されたメトリクスを用いて各パイプラインを評価する。
  • 各コンponentごとに動的ハードウェア割り当てが可能であり、Dockerコンテナを介してユーザーがカスタムの前処理コンponentやアルゴリズムを統合できる。
  • モデルは低遅延の SageMaker エンドポイントとしてデプロイされ、トレーニング、チューニング、推論の各段階を含めたエンドツーエンドでのパフォーマンスが測定される。

実験結果

リサーチクエスチョン

  • RQ1産業規模の機械学習ワークフローにおいて、自動化と透明性、ユーザー制御のバランスをどのようにとることができるか?
  • RQ2トレーニングデータが限られている状況で、メタラーニングとヒューリスティクスに従う探索が、パイプライン選択にどの程度向上をもたらすか?
  • RQ3完全にマネージドされた AutoML システムは、熟練者がチューニングしたモデルと同等のパフォーマンスを達成できるか、かつ低遅延を維持できるか?
  • RQ4複雑なデータタイプを有する多様で現実世界の表形式データセットに対して、システムはどのようにスケーリングされるか?
  • RQ5パフォーマンスや保守性を損なわず、拡張性とカスタマイズ性を実現するためのアーキテクチャパターンは何か?

主な発見

  • Autopilot はすべてのデータセットでデフォルトの XGBoost ベースラインを上回り、相対誤差差分という指標において一貫した改善が確認された。
  • システムは高いジョブ成功率を達成し、ベンチマークに含まれる大多数のデータセットでエンドツーエンドのパイプライン生成とモデルデプロイメントを正常に完了した。
  • 85% のデータセットで Autopilot はベースライン手法の性能を同等または上回り、多様なデータタイプにわたる堅牢性が示された。
  • Autopilot モデルの平均推論エンドポイント遅延は、100行のバッチあたり100ms未満で測定され、生産環境適合性が裏付けられた。
  • アンサンブル手法を用いていないにもかかわらず、Autopilot のパフォーマンスは最先端のベースラインと同等であり、パイプライン探索とチューニング戦略の有効性が示された。
  • モジュラでコンテナ化されたアーキテクチャにより、新しいアルゴリズムやカスタム前処理コンponentの統合がスムーズに可能となり、拡張性が確保され、今後の非表形式データへの拡張にも対応できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。