Skip to main content
QUICK REVIEW

[論文レビュー] Pennsieve: A Collaborative Platform for Translational Neuroscience and Beyond

Zack Goldblum, Zhida Xu|arXiv (Cornell University)|Sep 16, 2024
Science, Research, and MedicineMedicine被引用数 3
ひとこと要約

Pennsieveは、翻訳神経科学および多様な分野の研究を対象として設計されたオープンソースでクラウドベースの科学的データ管理プラットフォームです。FAIR準拠のデータキュレート、共同作業スペース、高度なメタデータ管理を可能にし、350以上の高インパクトデータセット(合計125 TB、うち35 TBが公開)をカバーするマルチモーダルデータセットをサポートしており、NIH SPARC や HEAL といった主要なイニシアチブに統合されています。

ABSTRACT

The exponential growth of neuroscientific data necessitates platforms that facilitate data management and multidisciplinary collaboration. In this paper, we introduce Pennsieve - an open-source, cloud-based scientific data management platform built to meet these needs. Pennsieve supports complex multimodal datasets and provides tools for data visualization and analyses. It takes a comprehensive approach to data integration, enabling researchers to define custom metadata schemas and utilize advanced tools to filter and query their data. Pennsieve's modular architecture allows external applications to extend its capabilities, and collaborative workspaces with peer-reviewed data publishing mechanisms promote high-quality datasets optimized for downstream analysis, both in the cloud and on-premises. Pennsieve forms the core for major neuroscience research programs including NIH SPARC Initiative, NIH HEAL Initiative's PRECISION Human Pain Network, and NIH HEAL RE-JOIN Initiative. It serves more than 80 research groups worldwide, along with several large-scale, inter-institutional projects at clinical sites through the University of Pennsylvania. Underpinning the SPARC.Science, Epilepsy.Science, and Pennsieve Discover portals, Pennsieve stores over 125 TB of scientific data, with 35 TB of data publicly available across more than 350 high-impact datasets. It adheres to the findable, accessible, interoperable, and reusable (FAIR) principles of data sharing and is recognized as one of the NIH-approved Data Repositories. By facilitating scientific data management, discovery, and analysis, Pennsieve fosters a robust and collaborative research ecosystem for neuroscience and beyond.

研究の動機と目的

  • 異なるフォーマットやリポジトリに散在する大規模かつマルチモーダルな神経科学データセットを管理するという急増する課題に対処する。
  • 神経科学分野におけるデータのスロットルを克服し、相互運用可能でFAIR準拠のデータ共有と統合を可能にする。
  • セキュアでバージョン管理された作業スペースと査読付きデータ公開を通じて、共同で行う多様な分野の研究を支援する。
  • データセットとのコード統合、詳細なメタデータ、アノテーションを可能にすることで、再現性のある研究を促進する。
  • 多様な研究機関に対応できるスケーラブルでモジュラーなプラットフォームを提供し、クラウドおよびオンプレミスの両方のデプロイメントをサポートする。

提案手法

  • マイクロサービスおよびサーバーヲス関数を活用したモジュラーでクラウドネイティブなアーキテクチャを採用し、プラットフォーム機能を拡張する。
  • カスタムメタデータスキーマとグラフベースのメタデータモデリングをサポートし、複雑なデータ関係性と意味的リンクを可能にする。
  • 時系列データ、画像、ゲノム、計算モデルデータの分野固有のデータビューアーを統合し、オーバーレイアノテーションツールを提供する。
  • 包括的なRESTful APIを提供し、サードパーティアプリケーションとの統合およびカスタムデータパイプライン開発を可能にする。
  • 恒久的DOI、標準化されたメタデータ、アクセス制御、機械可読のデータ記述を通じて、FAIR原則を採用する。
  • ロールベースのアクセス制御とバージョン管理済みデータセット公開を備えた共同作業スペースを導入し、再現性と監査可能性を確保する。

実験結果

リサーチクエスチョン

  • RQ1スケーラブルでクラウドベースのプラットフォームは、大規模かつマルチモーダルな神経科学研究におけるデータ統合と協働作業をどのように改善できるか?
  • RQ2FAIR準拠のデータ管理システムは、機関間でのデータスロットルをどの程度軽減し、データセットの再利用性を向上させられるか?
  • RQ3カスタマイズ可能なメタデータおよびアノテーションインfraストラクチャは、マルチモーダルデータの発見と分析をどのように可能にするか?
  • RQ4モジュラーでAPIファーストのアーキテクチャは、外部の科学的ツールやワークフローとの拡張性と統合をどのように支援するか?
  • RQ5統合されたプラットフォームは、臨床的、前臨床的、計算的研究を含む多様な神経科学イニシアチブを効果的に支援できるか?

主な発見

  • Pennsieveは、125 TBの科学的データにわたる350以上の公開可能で高インパクトのデータセットをホスティングしており、そのうち35 TBが一般に公開されている。
  • プラットフォームは、NIH SPARC、NIH HEAL PRECISION Human Pain Network、RE-JOINを含む主要な国際的イニシアチブに統合されており、世界中で80以上の研究グループが利用している。
  • Pennsieveは、EEG、MEG、MRI、顕微鏡、遺伝子発現、3次元モデル、計算シミュレーションを含む多様なデータモダリティをサポートしている。
  • バージョン管理、恒久的DOI、構造化されたメタデータを備えた査読付きデータ公開を可能にし、データセットの再現性と引用可能性を向上させている。
  • 統合されたデータビューアーとアノテーションツールにより、ユーザーはプラットフォーム上で直接時系列データ、画像、ゲノムデータを可視化およびアノテートできる。
  • PennsieveはNIH承認のデータリポジトリとして認められており、FAIR原則を遵守しており、神経科学データの長期的な検索可能性、アクセス可能性、再利用可能性を保証している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。