Skip to main content
QUICK REVIEW

[论文解读] Data Cleaning and Machine Learning: A Systematic Literature Review

Pierre-Olivier Côté, Amin Nikanjam|arXiv (Cornell University)|Oct 3, 2023
Data Quality and Management被引用 6
一句话总结

本篇系统性文献回顾综合分析了2016至2022年间101项关于机器学习数据清洗(DC4ML)与机器学习用于数据清洗(ML4DC)的研究,识别出六项核心数据清洗活动——特征清洗、标签清洗、实体匹配、异常值检测、填补缺失值以及整体性清洗。本研究提出24项可操作的未来研究方向,重点关注数据增强、公开数据集、工具开发、大语言模型(LLMs)、整体性方法以及交互式清洗。

ABSTRACT

Context: Machine Learning (ML) is integrated into a growing number of systems for various applications. Because the performance of an ML model is highly dependent on the quality of the data it has been trained on, there is a growing interest in approaches to detect and repair data errors (i.e., data cleaning). Researchers are also exploring how ML can be used for data cleaning; hence creating a dual relationship between ML and data cleaning. To the best of our knowledge, there is no study that comprehensively reviews this relationship. Objective: This paper's objectives are twofold. First, it aims to summarize the latest approaches for data cleaning for ML and ML for data cleaning. Second, it provides future work recommendations. Method: We conduct a systematic literature review of the papers published between 2016 and 2022 inclusively. We identify different types of data cleaning activities with and for ML: feature cleaning, label cleaning, entity matching, outlier detection, imputation, and holistic data cleaning. Results: We summarize the content of 101 papers covering various data cleaning activities and provide 24 future work recommendations. Our review highlights many promising data cleaning techniques that can be further extended. Conclusion: We believe that our review of the literature will help the community develop better approaches to clean data.

研究动机与目标

  • 全面总结近年来在机器学习数据清洗(DC4ML)与机器学习用于数据清洗(ML4DC)领域的进展,探讨两者的双重关系。
  • 识别并分类六项核心数据清洗活动(特征清洗、标签清洗、实体匹配、异常值检测、填补缺失值以及整体性清洗)中的最新技术。
  • 基于实证证据,提出可操作的未来研究方向,为研究人员和实践者改进机器学习系统的数据质量提供指导。
  • 通过提供结构化、基于实证的最新数据清洗方法综述,支持新兴的以数据为中心的AI(DCAI)运动。
  • 通过遵循系统性文献回顾(SLR)流程,确保方法论严谨性与可复现性,包括透明的筛选流程、质量控制机制以及公开的复现代码包。

提出的方法

  • 依据PRISMA指南开展系统性文献回顾(SLR),涵盖2016至2022年间来自IEEE Xplore、ACM Digital Library及Springer等主要学术数据库的出版物。
  • 实施多阶段筛选流程:首先通过关键词搜索与滚雪球法进行初步检索,随后依据相关性、数据类型(表格、文本、图像)及出版质量设定纳入/排除标准。
  • 采用质量控制问题评估方法论严谨性,确保对所选论文的准确解读,并在每个筛选阶段实施双人评审验证。
  • 构建分类体系,将数据清洗活动划分为六类:特征清洗、标签清洗、实体匹配、异常值检测、填补缺失值以及整体性数据清洗。
  • 从101篇高质量论文中提取并综合关键技术、模型与评估指标,重点关注可复现性与表述清晰性。
  • 在GitHub上提供公开的复现代码包,包含所有筛选后的论文、质量评分及提取的数据,以确保透明性与可复现性。

实验结果

研究问题

  • RQ12016至2022年间,用于提升机器学习模型性能的数据清洗技术(DC4ML)中,哪些最为突出?
  • RQ2近年来,机器学习的进展如何被应用于自动化或增强数据清洗流程(ML4DC)?
  • RQ3在特征清洗、标签修正或异常值检测等数据清洗活动中,哪些领域研究最为活跃,其主导方法论为何?
  • RQ4基于文献分析,当前机器学习数据清洗方法存在哪些关键缺口与局限性?
  • RQ5在机器学习系统中推进数据清洗方面,哪些未来研究方向最具前景?

主要发现

  • 本研究识别出2016至2022年间发表的101篇相关论文,涵盖多种数据类型(表格、文本、图像)及数据清洗活动。
  • 特征清洗与标签清洗是研究最频繁的活动,其方法多利用模型不确定性、主动学习与弱监督技术。
  • 异常值检测与填补缺失值技术越来越多地采用深度学习与自监督模型,尤其在高维或噪声较大的数据环境中。
  • 实体匹配与整体性数据清洗正日益受到关注,近期方法结合图神经网络与多任务学习以提升准确性。
  • 大量研究依赖合成数据或专有数据集,凸显了对更多公开、高质量数据清洗基准的迫切需求。
  • 本研究识别出24项未来研究方向,包括利用大语言模型(LLMs)进行数据清洗、改进数据增强技术,以及开发交互式、用户参与式清洗工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。