Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning Automation Toolbox (MLaut)

Viktor Kazakov, Franz J. Király|arXiv (Cornell University)|Jan 11, 2019
Machine Learning and Data Classification参考文献 34被引用数 4
ひとこと要約

本論文では、複数のデータセットにわたる教師あり学習アルゴリズムのスケーラブルなベンチマークを簡素化する、Pythonベースの機械学習自動化ツールボックスであるMLautを紹介する。このツールは、scikit-learnおよびKerasモデルの自動評価、ハイパーパramータチューニング、統計的比較を可能にし、視覚や自然言語処理(NLP)の特殊分野を除き、深層ニューラルネットワークが標準的な表形式データセットでは性能を発揮しないことを明らかにした。

ABSTRACT

In this paper we present MLaut (Machine Learning AUtomation Toolbox) for the python data science ecosystem. MLaut automates large-scale evaluation and benchmarking of machine learning algorithms on a large number of datasets. MLaut provides a high-level workflow interface to machine algorithm algorithms, implements a local back-end to a database of dataset collections, trained algorithms, and experimental results, and provides easy-to-use interfaces to the scikit-learn and keras modelling libraries. Experiments are easy to set up with default settings in a few lines of code, while remaining fully customizable to the level of hyper-parameter tuning, pipeline composition, or deep learning architecture. As a principal test case for MLaut, we conducted a large-scale supervised classification study in order to benchmark the performance of a number of machine learning algorithms - to our knowledge also the first larger-scale study on standard supervised learning data sets to include deep learning algorithms. While corroborating a number of previous findings in literature, we found (within the limitations of our study) that deep neural networks do not perform well on basic supervised learning, i.e., outside the more specialized, image-, audio-, or text-based tasks.

研究の動機と目的

  • 多様なデータセットにおける機械学習アルゴリズムのスケーラブルなベンチマークを自動化すること。
  • scikit-learnおよびKerasモデルを統合する単一のワークフロー内で使用可能な統一的で使いやすいインターフェースを提供すること。
  • カスタマイズ可能なハイパーパramータチューニング、パイプライン構成、ディープラーニングアーキテクチャ設計をサポートすること。
  • ローカルデータベースをバックエンドに持つストレージにより、再現可能で再開可能な実験を可能にすること。データセット、モデル、結果を保存できる。
  • 標準的な表形式データセットにおける従来の機械学習モデルとディープラーニングモデルを大規模に実証的に比較する研究を実施すること。

提案手法

  • MLautは、データロード、モデルフィッティング、予測、結果の保存を抽象化したハイレベルなワークフローアプリケーションプログラミングインターフェース(API)を提供する。
  • scikit-learn分類器やKerasディープネットワークなどの推定器を、デフォルト設定を含む統一インターフェースにラッピングする。
  • ツールボックスはローカルファイルシステムストレージを使用し、データセット、トレーニング済みモデル、予測結果、および結果を自動的に管理する。
  • リサンプリング戦略(例:交差検証)をサポートし、性能比較のための統計的後処理分析を統合する。
  • 平均、集計、順位ベースの指標を用いて性能を測定し、信頼区間と非パラメトリック検定(例:Wilcoxon符号順位検定)を適用する。
  • クラッシュ後に実験を再開できる仕組みを備え、長時間にわたるベンチマークパイプラインの耐障害性を確保する。

実験結果

リサーチクエスチョン

  • RQ1標準的な表形式分類データセットにおいて、従来の機械学習モデルとディープニューラルネットワークの性能はどのように比較されるか?
  • RQ2幅広いベンチマークデータセットにわたるさまざまなアルゴリズムの性能安定性とばらつきはどの程度か?
  • RQ3自動ハイパーパramータチューニングおよびパイプライン構成は、多様なデータタイプにおいてモデル性能を向上させることができるか?
  • RQ4さまざまなディープラーニングアーキテクチャ(例:ワイドvsディープ、ドロップアウト有無)は、非専門分野の学習タスクにおいてどのように性能を発揮するか?
  • RQ5複数のデータセットにわたるアルゴリズム性能を比較する際、信頼区間と後処理検定を考慮した場合、最も適切な統計的手法は何か?

主な発見

  • ドロップアウトや学習率チューニングを施したさまざまなアーキテクチャを備えたディープニューラルネットワークは、標準的な表形式データセットでは従来の機械学習モデルに比べて性能が低かった。
  • 最も高い性能を示したのは通常の推定器であり、GradientBoostingClassifier、ランダムフォレスト、SVMが、大多数のデータセットでディープネットワークを上回った。
  • wine_qualityデータセットでは、最良のディープラーニングモデル(NN-4-layer_wide_with_dropout_lr1)が69.76%の正解率を達成したが、最良の従来モデル(SVC)は35.50%にとどまり、顕著な性能差が確認された。
  • yeastデータセットでは、最良のディープネットワーク(NN-12-layer_wide_with_dropout_lr1)が71.22%の正解率を記録したが、ガウス・ナイーブベイズモデル(GaussianNaiveBayes)は85.92%に達し、単純なモデルの優れた性能が顕著に現れた。
  • 本研究では、画像、音声、テキスト分野を除く標準的な教師あり学習タスクにおいて、ディープラーニングモデルが一般化しにくく、広範なハイパーパramータチューニングを行ってもその傾向に変化がなかった。
  • 統計的検定により、モデル間の性能差が顕著に確認され、非ディープラーニングモデルが複数のデータセットにわたって一貫して高い順位を獲得した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。