Skip to main content
QUICK REVIEW

[论文解读] Open science in machine learning

Joaquin Vanschoren, Mikio L. Braun|TU/e Research Portal|Feb 24, 2014
Machine Learning and Data Classification被引用 8
一句话总结

本文介绍了 OpenML 和 mldata,这两个开放科学平台使研究人员能够共享机器学习数据、算法和实验结果——包括元数据、可复现的工作流程以及标准化评估——从而提升机器学习研究的透明度、可复现性和协作性。

ABSTRACT

We present OpenML and mldata, open science platforms that provides easy access to machine learning data, software and results to encourage further study and application. They go beyond the more traditional repositories for data sets and software packages in that they allow researchers to also easily share the results they obtained in experiments and to compare their solutions with those of others.

研究动机与目标

  • 通过创建用于数据、代码和结果的开放平台,解决机器学习实验缺乏共享、可重用和可复现的问题。
  • 通过存储详细的实验元数据和执行轨迹,提升机器学习研究的透明度和可复现性。
  • 通过聚合数千个不同数据集上的实验结果,实现大规模基准测试和元学习。
  • 通过与 Weka、R、RapidMiner 和 KNIME 等现有机器学习工具无缝集成,实现广泛采用。
  • 通过支持直接比较多种数据集和任务上的算法及参数设置,促进协作研究。

提出的方法

  • OpenML 采用基于任务的模型,每个任务定义一个机器学习问题(例如,在数据集 Y 上预测目标 X),包括输入数据、训练/测试划分和评估指标。
  • 实验以“运行”形式提交,包含任务、算法/工作流及结果,并附带超参数和执行环境的元数据。
  • 通过 REST API 支持程序化提交和检索数据、任务、实现和结果,支持与主要机器学习平台的集成。
  • mldata 支持基于 HDF5 的标准化文件格式,用于监督学习数据,支持结构化元数据、自动格式转换和对数组的直接访问。
  • 两个平台在统一数据库中关联数据、任务、算法和结果,支持跨实验的高级查询、可视化和聚合。
  • OpenML 和 mldata 正在整合,以实现跨平台的数据集和学习方法共享,提升互操作性和数据重用性。

实验结果

研究问题

  • RQ1如何通过共享超出数据和代码的详细实验结果,使机器学习研究更具透明度和可复现性?
  • RQ2需要什么样的基础设施,才能实现在多样化数据集和任务上大规模、协作式的机器学习算法基准测试?
  • RQ3研究人员如何能高效比较多种数据集上的算法性能,同时追踪参数影响和模型行为?
  • RQ4标准化元数据和结构化工作流在支持元学习和实验结果自动化分析方面发挥什么作用?
  • RQ5如何扩展现有的机器学习工具,使其原生支持自动结果共享和可复现执行等开放科学实践?

主要发现

  • OpenML 允许研究人员大规模提交、搜索和比较机器学习实验,并使用标准化指标实现自动评估。
  • 该平台支持与 Weka、R、RapidMiner 和 KNIME 等流行工具的集成,可在常规工作流中自动提交结果。
  • OpenML 为每个算法和数据集生成在线概览页面,汇总所有任务和参数设置下的性能表现。
  • mldata 支持基于 HDF5 的标准化格式用于监督学习数据,支持结构化元数据和自动格式转换。
  • OpenML 和 mldata 的整合实现了两个平台间数据集和学习方法的无缝共享,提升了数据和工具的互操作性。
  • 这些平台支持通过 SQL 和预定义模板进行高级查询,使研究人员能直接从聚合结果生成数据表、散点图和折线图。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。