Skip to main content
QUICK REVIEW

[论文解读] Data Engineering for Everyone

Vijay Janapa Reddi, Greg Diamos|arXiv (Cornell University)|Feb 23, 2021
Scientific Computing and Data Management参考文献 1被引用 5
一句话总结

本文倡导一场类似于开源软件运动的数据工程革命,提出通过自动化、社区驱动的框架来大规模加速开放数据集的创建。通过分析2,000多篇人工智能研究论文,发现78.3%的研究依赖于开放数据集,并以People’s Speech和1000 Words in 1000 Languages等案例研究展示了如何通过合成与自动化数据生成技术,创建高质量、低成本的数据集,从而实现机器学习创新的民主化、可复现性和可扩展性。

ABSTRACT

Data engineering is one of the fastest-growing fields within machine learning (ML). As ML becomes more common, the appetite for data grows more ravenous. But ML requires more data than individual teams of data engineers can readily produce, which presents a severe challenge to ML deployment at scale. Much like the software-engineering revolution, where mass adoption of open-source software replaced the closed, in-house development model for infrastructure code, there is a growing need to enable rapid development and open contribution to massive machine learning data sets. This article shows that open-source data sets are the rocket fuel for research and innovation at even some of the largest AI organizations. Our analysis of nearly 2000 research publications from Facebook, Google and Microsoft over the past five years shows the widespread use and adoption of open data sets. Open data sets that are easily accessible to the public are vital to accelerating ML innovation for everyone. But such open resources are scarce in the wild. So, what if we are able to accelerate data-set creation via automatic data set generation tools?

研究动机与目标

  • 通过实现快速、可扩展且开放的数据集创建,应对机器学习领域日益严峻的数据稀缺危机。
  • 通过开发类似开源软件开发的工具与框架,实现数据工程的民主化,降低对专有、内部数据管道的依赖。
  • 通过向研究人员、学生和开发者广泛提供高质量、可访问且可复现的数据集,加速机器学习创新。
  • 建立评估开放数据集质量、许可协议和伦理考量的标准与指标,以确保其可信度与可用性。
  • 通过MLCommons、People’s Speech和Speech Commands等开放倡议,推动社区驱动的数据工程,实现高效的数据生产规模化。

提出的方法

  • 分析2015至2021年间来自Facebook、Google和Microsoft的1,980篇研究论文,量化主要机器学习会议中开放数据集的使用情况。
  • 利用大型语言模型和语音合成技术,开发自动化数据生成流水线,以生成合成的、带标签的文本和音频数据。
  • 利用现有开放数据集(如Common Voice)和强制对齐工具,自动提取并标注关键词,用于关键词识别模型的训练。
  • 应用自动语音识别和强制对齐技术,将音频分割为词级片段,替代人工标注。
  • 实施支持可复现性、版本控制和许可检查的数据工程框架,以确保数据集的质量与合规性。
  • 通过MLCommons等开放平台促进社区贡献,实现数据集的协作开发与验证。

实验结果

研究问题

  • RQ1领先的人工智能机构在其研究论文中,在多大程度上依赖开放数据集而非专有数据集?
  • RQ2自动化、社区驱动的数据工程流水线能否显著降低大规模、高质量机器学习数据集的创建成本与时间?
  • RQ3为实现与开源软件开发相同的效率,需要哪些技术和组织框架来规模化开放数据集的生产?
  • RQ4如何系统性地评估并强制执行自动生成数据集中关于许可、质量和伦理考量的问题?
  • RQ5学术机构与开源社区在推动数据工程作为机器学习核心学科方面,应发挥何种作用?

主要发现

  • 在2015至2021年间,来自Facebook、Google和Microsoft的1,980篇产业研究论文中,78.3%使用了开放数据集,表明公共数据在可复现研究中被广泛依赖。
  • 开放数据集的使用呈上升趋势,表明社区对公共数据在基准测试与创新中信任度不断提高。
  • 自动化数据生成流水线(如People’s Speech和1000 Words in 1000 Languages项目所采用)以不到20,000美元的成本生成了87,000小时的带标签语音数据,证明了大规模应用下的成本效率。
  • 强制对齐与预训练模型可实现词级音频片段的自动提取,使人工标注工作量降低数个数量级。
  • 许可与伦理问题仍是关键挑战,即使采用CC-0许可的数据,也可能在大规模监控等敏感应用中被误用。
  • 社区驱动的数据工程倡议(如MLCommons主导的项目)正成为可持续、可扩展且透明的数据集开发的可行范式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。