Skip to main content
QUICK REVIEW

[论文解读] Data Engineering for Data Analytics: A Classification of the Issues, and Case Studies

Alfredo Nazábal, Christopher K. I. Williams|arXiv (Cornell University)|Apr 27, 2020
Big Data and Business Intelligence被引用 9
一句话总结

本文提出了一种面向数据分析中数据工程挑战的结构化分类,将其归纳为三大高层次类别:数据组织、数据质量和特征工程。文章展示了四个具有公开数据集和清洗流程的真实案例研究,展示了实用的数据清洗工作流程,并倡导开发自动化工具以减少数据准备中的手动工作量,为数据工程自动化领域的未来研究奠定基础。

ABSTRACT

Consider the situation where a data analyst wishes to carry out an analysis on a given dataset. It is widely recognized that most of the analyst's time will be taken up with \\emph{data engineering} tasks such as acquiring, understanding, cleaning and preparing the data. In this paper we provide a description and classification of such tasks into high-levels groups, namely data organization, data quality and feature engineering. We also make available four datasets and example analyses that exhibit a wide variety of these problems, to help encourage the development of tools and techniques to help reduce this burden and push forward research towards the automation or semi-automation of the data engineering process.

研究动机与目标

  • 为解决缺乏标准化、公开可用的混乱数据集及其文档化清洗流程的问题,此类问题阻碍了数据工程自动化研究的进展。
  • 识别并系统性分类数据科学家在分析任务中面临的数据清洗常见问题。
  • 提供详细清洗工作流程的实际、真实世界案例研究,作为开发自动化数据准备工具的基准。
  • 突出数据工程常被忽视的劳动密集性,其耗时可达数据科学家工作时间的80%。
  • 鼓励数据科学社区共享原始数据和清洗脚本,以推动数据工程中可复现性和工具开发的进步。

提出的方法

  • 提出数据工程问题的三级分类:数据组织(数据解析、数据字典、数据集成、数据转换)、数据质量(规范化、缺失数据、异常值、非平稳性)和特征工程。
  • 识别并记录了来自不同领域(植物性状、家庭用电、健康记录、宽带调查)的四个真实世界数据集及其相关分析任务。
  • 针对每个数据集,详细说明完整的数据清洗流程,包括数据发现、模式识别、清洗操作和转换步骤。
  • 采用任务驱动方法:每个数据集均被清洗为特定机器学习模型的输入,反映现实世界中的分析约束。
  • 在多个数据集上采用系统化、分步的清洗流程,包括处理缺失值、标准化分类编码,以及合并具有不一致模式的多年数据。
  • 通过GitHub仓库公开所有数据集和清洗脚本,以支持可复现性和工具评估。

实验结果

研究问题

  • RQ1数据科学家在准备真实世界数据集以供分析时,面临的主要且反复出现的数据工程挑战是什么?
  • RQ2如何系统性地对数据工程问题进行分类,以支持自动化或半自动化工具的开发?
  • RQ3真实世界分析项目中的实际数据清洗工作流程是什么?它们在不同领域之间有何差异?
  • RQ4公开共享带有文档化清洗流程的原始数据集在多大程度上能加速数据工程和自动化研究?
  • RQ5在真实数据集中,哪些关键的数据质量与组织问题对下游建模性能影响最大?

主要发现

  • 数据工程任务——如数据集成、缺失值处理和模式标准化——消耗了数据科学家高达80%的时间,通常未在最终分析中报告。
  • 四个案例研究表明,跨年度数据集进行集成且模式不一致是主要挑战,需手动匹配列、重命名及标准化编码。
  • 当每特征缺失率低于1%时,通过删除含缺失值的实例来处理缺失数据,这是一种实用但并非总是最优的方法。
  • 尽管数据质量和组织问题各异,所有四个数据集均成功清洗并用于训练多个分类器(逻辑回归、朴素贝叶斯、SVM、随机森林),其中随机森林在2016年测试集上达到最高F1分数0.8686。
  • 研究发现,数据清洗高度依赖任务,缺乏通用流程,真实工作流中常见反馈回路和迭代决策。
  • 原始数据和完整清洗脚本的可用性支持了可复现性,并为基准化自动化数据工程工具提供了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。