Skip to main content
QUICK REVIEW

[論文レビュー] AutoML to Date and Beyond: Challenges and Opportunities

Shubhra Kanti Karmaker Santu, Md. Mahadi Hassan|arXiv (Cornell University)|Oct 21, 2020
Machine Learning and Data Classification参考文献 57被引用数 6
ひとこと要約

本稿では、機械学習パイプラインの完全自動化のギャップを埋めるために、AutoMLシステムのための七段階の自律性分類法を提案する。本稿は、予測タスクの定式化と推薦を自動化するインタラクティブで知的なエージェント(レベル6 AutoML)を導入し、データサイエンティストおよびドメインスペシャリストの人的関与を顕著に低減する。事例研究により、実世界のタスク推薦における実現可能性が示された。

ABSTRACT

As big data becomes ubiquitous across domains, and more and more stakeholders aspire to make the most of their data, demand for machine learning tools has spurred researchers to explore the possibilities of automated machine learning (AutoML). AutoML tools aim to make machine learning accessible for non-machine learning experts (domain experts), to improve the efficiency of machine learning, and to accelerate machine learning research. But although automation and efficiency are among AutoML's main selling points, the process still requires human involvement at a number of vital steps, including understanding the attributes of domain-specific data, defining prediction problems, creating a suitable training data set, and selecting a promising machine learning technique. These steps often require a prolonged back-and-forth that makes this process inefficient for domain experts and data scientists alike, and keeps so-called AutoML systems from being truly automatic. In this review article, we introduce a new classification system for AutoML systems, using a seven-tiered schematic to distinguish these systems based on their level of autonomy. We begin by describing what an end-to-end machine learning pipeline actually looks like, and which subtasks of the machine learning pipeline have been automated so far. We highlight those subtasks which are still done manually - generally by a data scientist - and explain how this limits domain experts' access to machine learning. Next, we introduce our novel level-based taxonomy for AutoML systems and define each level according to the scope of automation support provided. Finally, we lay out a roadmap for the future, pinpointing the research required to further automate the end-to-end machine learning pipeline and discussing important challenges that stand in the way of this ambitious goal.

研究の動機と目的

  • 予測タスクの定式化とデータ準備における人的作業の多さによる、現在の機械学習パイプラインの非効率性とアクセス困難さを是正すること。
  • AutoMLにおける主要なボトル neck を同定すること:予測問題の定義と訓練データの準備を手作業で行うアドホックなプロセス。
  • エンドツーエンドの機械学習パイプラインにおける自動化の度合いに基づき、AutoMLシステムを分類するための新規七段階分類法を提案すること。
  • ドメインスペシャリストが直接機械学習を利用できるようにするために、知的なインタラクティブエージェント(レベル6)による予測タスクの定式化を自動化すること。
  • 真の自動化データサイエンスを達成するための研究ロードマップを提示し、タスク推薦とモデル評価における人間とAIの協働を強調すること。

提案手法

  • 機械学習パイプラインにおける自動化の範囲に基づき、AutoMLシステムを分類する七段階の自律性フレームワークを開発する。
  • レベル6 AutoMLを、文脈的・ドメイン固有の知識を用いて予測タスクを能動的に推薦・定式化するインタラクティブエージェントとして定義する。
  • 自然言語理解と可視化を統合し、説明文、入力、インスタンス例などの人間が読みやすい形式で予測タスクを提示する。
  • 反復的フィードバックを通じてユーザーと対話する予測タスク推薦システムを設計し、タスクの関連性と使いやすさを向上させる。
  • 実世界のデータセットを用いた事例研究を通じて、レベル6 AutoMLが意味的で実行可能な予測タスクを推薦できるかを検証する。
  • 偏りのないデータ分割、代表的なベンチマーク、訓練ラベルにおける最小限のアノテーションバイアスを確保することで、強固なモデル評価を強調する。

実験結果

リサーチクエスチョン

  • RQ1現代のAutoMLシステムでさえも、手作業で行う必要があるエンドツーエンドの機械学習パイプラインの主な段階は何か?
  • RQ2人間が定義した仕様に依存せずに、AutoMLシステムが予測タスクの定式化においてより高い自律性を達成する方法は何か?
  • RQ3知的なインタラクティブなタスク推薦が可能なレベル6 AutoMLエージェントを構築するにあたり、克服すべき技術的および設計上の課題は何か?
  • RQ4予測タスクを意味的に適切に表現・評価するには、どのような方法が必要か? これにより、実世界のビジネス目標とデータ文脈に整合するようにする。
  • RQ5人間とAIの協働は、自動化された機械学習ワークフローの正確性と使いやすさを向上させるために果たす役割は何か?

主な発見

  • 現在のAutoMLシステムは、予測タスクの定式化と訓練データの準備において、データサイエンティストからの広範な人的入力を必要としているため、真の自動化とは言えない。
  • 機械学習パイプラインの大部分、特にタスク定式化の段階が人間中心のプロセスのままであり、ドメインスペシャリストのアクセス性を制限している。
  • 文脈に即した予測タスク推薦が可能なレベル6 AutoMLエージェントは実現可能であり、実世界の事例研究においてその可能性が示された。
  • 効果的なタスク推薦には、技術的自動化に加え、自然言語による説明や入力・予測の可視化を含む直感的なユーザーインターフェースが不可欠である。
  • 公平で偏りのないモデル評価はAutoMLの成功に不可欠であり、パイプライン全体にわたり、適切なデータキュレーション、ベンチマーク、ラベル品質の確保に依存する。
  • データサイエンスにおける完全自動化を達成するには、ヒューマンコンピュータインタラクション、情報検索、データベース、ソフトウェア工学を統合する分野横断的研究が不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。