Skip to main content
QUICK REVIEW

[论文解读] Declarative Machine Learning - A Classification of Basic Properties and Types

Matthias Böehm, Alexandre Evfimievski|arXiv (Cornell University)|May 19, 2016
Machine Learning and Data Classification参考文献 29被引用 14
一句话总结

本文提出了一种基于核心属性(如数据独立性、操作抽象和结果正确性)的语法无关的声明式机器学习(ML)分类法。它将系统分类为类型——声明式ML任务、算法和库,证明了诸如MLbase、SystemML和DeepDive等多样化系统均符合这些原则,从而支持针对每类系统的标准化基准测试和定制化规格语言。

ABSTRACT

Declarative machine learning (ML) aims at the high-level specification of ML tasks or algorithms, and automatic generation of optimized execution plans from these specifications. The fundamental goal is to simplify the usage and/or development of ML algorithms, which is especially important in the context of large-scale computations. However, ML systems at different abstraction levels have emerged over time and accordingly there has been a controversy about the meaning of this general definition of declarative ML. Specification alternatives range from ML algorithms expressed in domain-specific languages (DSLs) with optimization for performance, to ML task (learning problem) specifications with optimization for performance and accuracy. We argue that these different types of declarative ML complement each other as they address different users (data scientists and end users). This paper makes an attempt to create a taxonomy for declarative ML, including a definition of essential basic properties and types of declarative ML. Along the way, we provide insights into implications of these properties. We also use this taxonomy to classify existing systems. Finally, we draw conclusions on defining appropriate benchmarks and specification languages for declarative ML.

研究动机与目标

  • 通过建立系统化、语法无关的分类框架,解决声明式ML定义中的模糊性。
  • 识别并形式化定义声明式ML系统的基本核心属性——物理数据独立性、数据流独立性和结果正确性。
  • 将现有系统(如MLbase、SystemML、DeepDive)归入所提出的分类法中,明确其与声明式ML原则的一致性。
  • 倡导针对不同类型设计基准测试和领域特定的规格语言,以反映声明式ML系统在工作负载和抽象层次上的差异。
  • 通过解耦算法语义与底层执行细节,支持可移植、可优化且可扩展的ML系统开发。

提出的方法

  • 定义三个核心属性:(1) 物理数据独立性(抽象数据类型隐藏存储与分布细节),(2) 数据流独立性(不暴露执行流程),(3) 结果正确性(确定性或有界误差结果)。
  • 提出声明式ML系统的三级分类:(1) 声明式ML任务(如模型搜索),(2) 声明式ML算法(如用于迭代算法的领域特定语言DSL),(3) 大规模ML库(如MLlib)作为基线。
  • 以Apache SystemML为例,展示核心属性在实践中的实现方式,特别是通过抽象数据类型和自动计划生成。
  • 通过将现有系统(如MLbase、Columbus、DeepDive)映射到分类法中,展示其对所定义属性的符合性。
  • 主张类型特定基准测试和领域特定规格语言的必要性,引用SciDB和SimSQL等现有示例,分别用于数组和贝叶斯ML工作负载。
  • 确立只要满足核心属性,语法本身与声明式ML无关,因此关于循环语法的争论与根本定义无关。

实验结果

研究问题

  • RQ1一个系统必须满足哪些基本属性,才能被认定为声明式机器学习,而与语法或实现无关?
  • RQ2如何基于抽象层次和行为,系统性地将现有ML系统分类为声明式ML的不同类型?
  • RQ3像MLbase、SystemML和DeepDive这样的系统在多大程度上符合所提出的声明式ML基本属性?
  • RQ4为何一刀切的基准测试不足以评估声明式ML系统?有效类型特定基准测试的特征是什么?
  • RQ5如何设计规格语言,以支持不同声明式ML系统类型的独特需求,同时避免语法绑定?

主要发现

  • 核心属性——物理数据独立性、数据流独立性和结果正确性——足以且必要地定义声明式ML,无论语法或控制流结构如何。
  • MLbase和Columbus被归类为声明式ML任务,因为它们通过优化目标指定高层学习问题,抽象出数据和执行细节。
  • SystemML通过支持高层DSL生成优化执行计划,同时隐藏物理数据表示和执行流程,体现了声明式ML算法的特征。
  • DeepDive在特征选择方面符合声明式ML系统标准,因为它通过SQL和用户定义函数(UDFs)抽象出统计推断和因子图计算,不暴露算法内部实现。
  • 该分类法能够清晰区分声明式ML系统与传统ML库,后者固定执行计划并暴露底层数据表示。
  • 本文结论认为,类型特定基准测试和领域特定规格语言对于公平评估和推动发展至关重要,这在数组和贝叶斯ML数据库的成功案例中已得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。