Skip to main content
QUICK REVIEW

[论文解读] SymbolicData:SDEval - Benchmarking for Everyone

Albert Heinle, Viktor Levandovskyy|arXiv (Cornell University)|Oct 18, 2013
Bioinformatics and Genomic Networks参考文献 8被引用 5
一句话总结

本文介绍了 SDEval,一个基于符号数据项目构建的灵活、开源的基准测试工具箱,旨在标准化并自动化计算机代数领域的可复现性能评估。它使用户能够跨多个计算机代数系统生成可执行基准测试,并提供监控、计时和通过结构化任务文件夹重现结果的工具,显著提升了算法研究中的透明度和可比性。

ABSTRACT

In this paper we will present SDeval, a software project that contains tools for creating and running benchmarks with a focus on problems in computer algebra. It is built on top of the Symbolic Data project, able to translate problems in the database into executable code for various computer algebra systems. The included tools are designed to be very flexible to use and to extend, such that they can be utilized even in contexts of other communities. With the presentation of SDEval, we will also address particularities of benchmarking in the field of computer algebra. Furthermore, with SDEval, we provide a feasible and automatizable way of reproducing benchmarks published in current research works, which appears to be a difficult task in general due to the customizability of the available programs. We will simultaneously present the current developments in the Symbolic Data project.

研究动机与目标

  • 解决计算机代数研究中缺乏标准化、可复现基准测试的问题。
  • 使开发者和研究人员能够轻松比较不同计算机代数系统在通用问题集上的性能表现。
  • 通过将输入、代码和结果打包为可共享、可移植的任务文件夹结构,促进已发表基准测试的自动复现。
  • 通过将抽象问题实例转换为多种系统的可执行代码,扩展符号数据项目的功能。
  • 通过提供可扩展、可定制的工具,支持社区驱动的基准测试,以应对新的计算问题和系统。

提出的方法

  • SDEval 使用转换器将符号数据数据库中的符号问题实例转换为多种计算机代数系统(如 Sage、Mathematica、Maple)的可执行代码。
  • 它提供命令行和图形用户界面,用于从标准化问题条目创建基准测试集。
  • 基准测试执行器会监控执行时间和内存使用情况,支持可配置的超时设置,并自动终止长时间运行的进程。
  • 结果以人类可读的 HTML 和机器可处理的 XML 格式记录,以增强透明度和自动化能力。
  • 该系统通过任务文件夹组织基准测试,封装输入、代码和输出,实现跨平台的轻松共享与可复现性。
  • 它支持与 Sage 的集成,通过可选接口连接 IntPS 数据库,使问题实例可直接在 Sage 环境中使用。

实验结果

研究问题

  • RQ1如何在不同系统和研究团队之间使计算机代数的基准测试更具可复现性和透明度?
  • RQ2自动化生成和执行跨系统基准测试以解决符号计算问题,需要怎样的基础设施?
  • RQ3如何系统性地将符号数据项目中的问题实例转换为多种计算机代数系统的可执行代码?
  • RQ4哪些机制可以确保在异构软件环境中的一致且可靠的性能结果比较?
  • RQ5如何设计基准测试工作流,以支持长期可复现性和社区扩展?

主要发现

  • SDEval 通过统一的任务文件夹结构,实现了在多个计算机代数系统之间创建标准化、可复现基准测试的能力。
  • 该工具支持对超出用户定义时间或内存限制的计算进行自动监控和终止,提升了基准测试的鲁棒性。
  • 结果以人类可读的 HTML 和机器可处理的 XML 格式报告,增强了透明度和自动化潜力。
  • 通过模块化设计,系统可轻松扩展至新的计算问题和额外的计算机代数系统。
  • 该方法使研究人员能够以极少的设置工作复现已发表的结果,显著降低了基准验证的门槛。
  • 与 Sage 的集成以及对 IntPS 数据库的支持,展示了其与现有符号计算生态系统的实际互操作性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。