[论文解读] A Case for Data Commons: Towards Data Science as a Service
本文提出数据共同体作为可扩展、互操作的基础设施,将数据、存储与计算资源集中部署,并配备共享的分析工具,以实现数据科学即服务(Data Science as a Service)。通过在多个数据共同体之间整合持久标识符、API、数据可移植性以及按计算付费的模式,该方法支持可复现、协作性及可扩展的数据科学,适用于大规模科学工作流,案例研究证明其在科研工作流中的可行性。
As the amount of scientific data continues to grow at ever faster rates, the research community is increasingly in need of flexible computational infrastructure that can support the entirety of the data science lifecycle, including long-term data storage, data exploration and discovery services, and compute capabilities to support data analysis and re-analysis, as new data are added and as scientific pipelines are refined. We describe our experience developing data commons-- interoperable infrastructure that co-locates data, storage, and compute with common analysis tools--and present several cases studies. Across these case studies, several common requirements emerge, including the need for persistent digital identifier and metadata services, APIs, data portability, pay for compute capabilities, and data peering agreements between data commons. Though many challenges, including sustainability and developing appropriate standards remain, interoperable data commons bring us one step closer to effective Data Science as Service for the scientific research community.
研究动机与目标
- 应对日益增长的科学数据集管理与分析挑战,这些数据集的规模已超出研究人员的处理能力。
- 构建可持续、互操作的网络基础设施,将数据、存储与计算资源集中部署,并配备通用分析工具。
- 通过提供持久数字标识符和版本化数据服务,实现可复现性与长期数据访问。
- 支持从小型到大规模分析的多样化研究工作负载,覆盖计算资源需求的全谱。
- 通过标准化API、身份认证与数据对等协议,促进不同数据共同体之间的互操作性。
提出的方法
- 设计并部署数据共同体作为集成平台,将数据、存储与高性能计算资源集中部署,并预装数据科学工具。
- 实施基于服务的架构,实现数据共同体与开放科学数据云(OSDC)之间的互操作性,OSDC是一个多拍字节的科学云。
- 采用软件即服务(SaaS)与平台即服务(PaaS)模式,提供对计算环境与分析流水线的按需访问。
- 建立标准化的数据管理实践,包括持久数字标识符、元数据服务以及安全的身份认证与授权协议。
- 通过按计算付费模式与数据可移植性功能,开发并运营数据共同体,以支持灵活、成本效益高的使用方式。
- 提出“分析运维”(AnalyticOps)概念,作为大规模数据分析与再分析的运维框架,类比于软件开发中的DevOps。
实验结果
研究问题
- RQ1如何设计数据共同体以支持完整的数据科学生命周期,包括存储、探索、分析与可复现性?
- RQ2实现独立数据共同体之间互操作性所需的哪些技术与组织标准?
- RQ3如何在单一基础设施中有效支持从小规模到大规模的数据分析工作负载?
- RQ4持久标识符、API与数据可移植性在实现可持续且可引用的数据科学中发挥何种作用?
- RQ5如何通过点对点互操作与共享服务,使数据共同体演变为一个联邦化的“数据之网”?
主要发现
- 随着数据量增长,数据共同体通过将数据与计算集中部署,显著降低了数据再分析的成本与复杂性。
- 当多个大型数据集被集中部署时,无论计算资源分配规模大小(从小型到大规模工作负载),均能催生重要的科学发现。
- 混合云模式——结合私有管理的计算舱(cyberpods)与公共云服务——在大规模场景下相比仅使用公共云更具成本优势。
- 通过标准化API、身份认证协议与数据对等协议,可实现数据共同体之间的互操作性,从而支持跨共同体的分析服务。
- 作为管理大规模数据分析流水线的方法论,“分析运维”(AnalyticOps)的出现,使高效、可重复且可扩展的数据科学工作流成为可能。
- 数据共同体作为未来“数据之网”的基础组件,支持多个共同体之间的互操作,从而实现更高阶的服务,如数据关联与发现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。