Skip to main content
QUICK REVIEW

[論文レビュー] Data Engineering for Data Analytics: A Classification of the Issues, and Case Studies

Alfredo Nazábal, Christopher K. I. Williams|arXiv (Cornell University)|Apr 27, 2020
Big Data and Business Intelligence被引用数 9
ひとこと要約

本稿は、データ分析におけるデータ工学の課題を体系的に分類し、3つのハイレベルなカテゴリに整理する:データ整理、データ品質、特徴工学。公開済みのデータセットとクリーニングパイプラインを用いた4つの実世界の事例を提示し、実用的なワーキングフローを示し、手作業によるデータ準備作業を削減するための自動化ツールの導入を提唱する。本研究は、データ工学の自動化分野における今後の研究の基盤を提供する。

ABSTRACT

Consider the situation where a data analyst wishes to carry out an analysis on a given dataset. It is widely recognized that most of the analyst's time will be taken up with \\emph{data engineering} tasks such as acquiring, understanding, cleaning and preparing the data. In this paper we provide a description and classification of such tasks into high-levels groups, namely data organization, data quality and feature engineering. We also make available four datasets and example analyses that exhibit a wide variety of these problems, to help encourage the development of tools and techniques to help reduce this burden and push forward research towards the automation or semi-automation of the data engineering process.

研究の動機と目的

  • データ工学の自動化分野における研究を阻害する、標準化されておらず、公開済みの汚れたデータセットと文書化されたクリーニングプロセスの欠如に対処すること。
  • データアナリティクスのタスクにおいてデータサイエンティストが直面する一般的なデータワーキング問題を特定し、体系的に分類すること。
  • 自動化されたデータ準備ツールの開発のためのベンチマークとして使用できる、詳細なクリーニングワークフローを含む実用的で現実的な事例を提供すること。
  • データ工学がしばしば軽視されるが、データサイエンティストの作業時間の最大80%を占めることを強調すること。
  • データサイエンスコミュニティが、再現可能性とツール開発の進展を図るため、生データとクリーニングスクリプトを共有するよう促すこと。

提案手法

  • データ工学の問題を3段階に分類する枠組みを提案:データ整理(データパース、データディクショナリー、データ統合、データ変換)、データ品質(正規化、欠損データ、異常値、非定常性)、特徴工学。
  • 多様な分野(植物特性、家庭用電力、健康記録、ブロードバンド調査)からの4つの実世界のデータセットと関連する分析タスクを特定・文書化。
  • 各データセットについて、データ発見、スキーマ同定、クリーニング操作、変換ステップを含む、完全なデータワーキングパイプラインを詳細に記述。
  • タスク指向のアプローチを採用:各データセットは、特定の機械学習モデルの入力として使用可能になるようにクリーニングされ、現実の分析制約を反映。
  • データセット全体にわたり、欠損値の処理、カテゴリカルエンコーディングの標準化、不整合なスキーマを持つ複数年のデータの統合を含む、体系的で段階的なクリーニングプロセスを実施。
  • すべてのデータセットとクリーニングスクリプトをGitHubリポジトリを通じて公開し、再現可能性とツール評価を支援。

実験結果

リサーチクエスチョン

  • RQ1データアナリティクスのための実世界のデータセットを準備する際、データサイエンティストが直面する代表的で繰り返し発生するデータ工学の課題は何か?
  • RQ2自動化またはセミ自動化ツールの開発を支援するため、データ工学の問題をどのように体系的に分類できるか?
  • RQ3実世界の分析プロジェクトにおける実用的なデータワーキングワークフローはどのようなものか。また、分野によってどのように異なるか?
  • RQ4文書化されたクリーニングプロセスを持つ公開済みの生データセットが、データ工学および自動化分野における研究をどの程度加速できるか?
  • RQ5実データセットにおいて、下流のモデリングパフォーマンスに最も顕著に影響を与える主なデータ品質およびデータ整理の問題は何か?

主な発見

  • データ統合、欠損値処理、スキーマ標準化といったデータ工学タスクは、データサイエンティストの作業時間の最大80%を占め、最終的な分析ではしばしば報告されない。
  • 4つの事例から、不整合なスキーマを持つ年次インストール間でのデータ統合が大きな課題であることが明らかになった。これは、手作業によるカラムマッチング、リネーム、エンコーディング標準化を要する。
  • 欠損データは、1つの特徴あたり欠損率が1%未満の場合、欠損値を含むインスタンスを削除することで処理されたが、これは現実的ではあるが、常に最適なアプローチではない。
  • データ品質や整理の問題が多様に存在するにもかかわらず、4つのデータセットすべてが正常にクリーニングされ、複数の分類器(ロジスティック回帰、ナイーブベイズ、SVM、ランダムフォレスト)の学習に使用された。その中でランダムフォレストが2016年のテストセットで最高のF1スコア0.8686を達成した。
  • 本研究では、データワーキングがタスクに強く依存しており、普遍的なパイプラインが存在しないことが明らかになった。フィードバックループや反復的判断が、現実のワークフローで一般的に見られる。
  • 生データと完全なクリーニングスクリプトの提供により、再現性が確保され、自動化されたデータ工学ツールのベンチマーク作成の基盤が提供された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。