[论文解读] Pennsieve: A Collaborative Platform for Translational Neuroscience and Beyond
Pennsieve 是一个开源的、基于云的科学数据管理平台,专为转化神经科学和多学科研究而设计。它支持符合 FAIR 原则的数据整理、协作工作区以及高级元数据管理,能够管理跨 350 多个高影响力数据集的多模态数据(总计 125 TB,其中 35 TB 为公开数据),并已集成至 NIH SPARC 和 HEAL 等主要科研计划。
The exponential growth of neuroscientific data necessitates platforms that facilitate data management and multidisciplinary collaboration. In this paper, we introduce Pennsieve - an open-source, cloud-based scientific data management platform built to meet these needs. Pennsieve supports complex multimodal datasets and provides tools for data visualization and analyses. It takes a comprehensive approach to data integration, enabling researchers to define custom metadata schemas and utilize advanced tools to filter and query their data. Pennsieve's modular architecture allows external applications to extend its capabilities, and collaborative workspaces with peer-reviewed data publishing mechanisms promote high-quality datasets optimized for downstream analysis, both in the cloud and on-premises. Pennsieve forms the core for major neuroscience research programs including NIH SPARC Initiative, NIH HEAL Initiative's PRECISION Human Pain Network, and NIH HEAL RE-JOIN Initiative. It serves more than 80 research groups worldwide, along with several large-scale, inter-institutional projects at clinical sites through the University of Pennsylvania. Underpinning the SPARC.Science, Epilepsy.Science, and Pennsieve Discover portals, Pennsieve stores over 125 TB of scientific data, with 35 TB of data publicly available across more than 350 high-impact datasets. It adheres to the findable, accessible, interoperable, and reusable (FAIR) principles of data sharing and is recognized as one of the NIH-approved Data Repositories. By facilitating scientific data management, discovery, and analysis, Pennsieve fosters a robust and collaborative research ecosystem for neuroscience and beyond.
研究动机与目标
- 应对在不同格式和存储库中管理大规模、多模态神经科学数据集日益增长的挑战。
- 通过实现可互操作的、符合 FAIR 原则的数据共享与整合,克服神经科学领域中的数据孤岛问题。
- 通过安全的、版本控制的协作工作区和经过同行评审的数据发布,支持协作性、多学科的研究。
- 通过支持详细的元数据、注释以及代码与数据集的集成,促进可重复研究。
- 提供可扩展、模块化的平台,支持云部署和本地部署,以满足多样化研究机构的需求。
提出的方法
- 采用微服务和无服务器函数的模块化、云原生架构,以扩展平台功能。
- 支持自定义元数据模式和基于图的元数据建模,以实现复杂的数据关系和语义关联。
- 集成特定领域的数据查看器,用于时间序列、影像、基因组和计算模型数据,并支持叠加注释工具。
- 提供全面的 RESTful API,以支持第三方应用程序集成和自定义数据处理管道的开发。
- 通过持久的 DOI、标准化元数据、访问控制和机器可读的数据描述,贯彻 FAIR 原则。
- 部署具有基于角色的访问控制和版本化数据集发布的协作工作区,以提升可重复性和可审计性。
实验结果
研究问题
- RQ1一个可扩展的云平台在多模态大规模神经科学研究中,如何提升数据整合与协作效率?
- RQ2一个符合 FAIR 原则的数据管理系统在多机构间在多大程度上能减少数据孤岛并提升数据集的可重用性?
- RQ3可自定义的元数据与注释基础设施在促进跨模态数据发现与分析方面发挥什么作用?
- RQ4模块化、以 API 优先的架构如何支持与外部科学工具和工作流的可扩展性和集成?
- RQ5一个统一的平台能否有效支持多样化的神经科学研究计划,包括临床、临床前和计算研究?
主要发现
- Pennsieve 主机托管了超过 350 个公开可用的高影响力数据集,涵盖 125 TB 的科学数据,其中 35 TB 对公众开放。
- 该平台已集成至多个国家级科研计划,包括 NIH SPARC、NIH HEAL PRECISION Human Pain Network 和 RE-JOIN,服务于全球超过 80 个研究团队。
- Pennsieve 支持多种数据模态,包括 EEG、MEG、MRI、显微成像、基因表达、3D 模型和计算模拟。
- 平台支持经过同行评审的数据发布,具备版本控制、持久 DOI 和结构化元数据,显著提升了数据集的可重复性和引用能力。
- 集成的数据查看器和注释工具使用户能够直接在平台上可视化和注释时间序列、影像和基因组数据。
- Pennsieve 被认定为 NIH 认可的数据存储库,并遵循 FAIR 原则,确保神经科学数据的长期可发现性、可访问性和可重用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。