Skip to main content
QUICK REVIEW

[논문 리뷰] Pennsieve: A Collaborative Platform for Translational Neuroscience and Beyond

Zack Goldblum, Zhida Xu|arXiv (Cornell University)|2024. 09. 16.
Science, Research, and MedicineMedicine인용 수 3
한 줄 요약

Pennsieve는 번역 신경과학 및 다학제 연구를 위한 오픈소스로 설계된 클라우드 기반 과학 데이터 관리 플랫폼입니다. FAIR 준수 데이터 셋 정제, 협업 워크스페이스, 고급 메타데이터 관리 기능을 제공하여 350개 이상의 고영향력 데이터셋(총 125TB, 공개 35TB)의 다중 모odal 데이터를 지원하며, NIH SPARC 및 HEAL과 같은 주요 연구 이니셔티브에 통합되어 있습니다.

ABSTRACT

The exponential growth of neuroscientific data necessitates platforms that facilitate data management and multidisciplinary collaboration. In this paper, we introduce Pennsieve - an open-source, cloud-based scientific data management platform built to meet these needs. Pennsieve supports complex multimodal datasets and provides tools for data visualization and analyses. It takes a comprehensive approach to data integration, enabling researchers to define custom metadata schemas and utilize advanced tools to filter and query their data. Pennsieve's modular architecture allows external applications to extend its capabilities, and collaborative workspaces with peer-reviewed data publishing mechanisms promote high-quality datasets optimized for downstream analysis, both in the cloud and on-premises. Pennsieve forms the core for major neuroscience research programs including NIH SPARC Initiative, NIH HEAL Initiative's PRECISION Human Pain Network, and NIH HEAL RE-JOIN Initiative. It serves more than 80 research groups worldwide, along with several large-scale, inter-institutional projects at clinical sites through the University of Pennsylvania. Underpinning the SPARC.Science, Epilepsy.Science, and Pennsieve Discover portals, Pennsieve stores over 125 TB of scientific data, with 35 TB of data publicly available across more than 350 high-impact datasets. It adheres to the findable, accessible, interoperable, and reusable (FAIR) principles of data sharing and is recognized as one of the NIH-approved Data Repositories. By facilitating scientific data management, discovery, and analysis, Pennsieve fosters a robust and collaborative research ecosystem for neuroscience and beyond.

연구 동기 및 목표

  • 다양한 형식과 저장소에 산재한 대규모 다중 모달 신경과학 데이터셋을 관리하는 데 증가하는 도전 과제를 해결하기 위해.
  • 신경과학 분야의 데이터 사각지대를 극복하기 위해 상호운용성 있고 FAIR 준수된 데이터 공유 및 통합을 가능하게 하기 위해.
  • 보안적이고 버전 관리가 가능한 워크스페이스와 피어리뷰된 데이터 출판을 통해 협업 및 다학제 연구를 지원하기 위해.
  • 데이터셋과 함께 상세한 메타데이터, 주석, 코드 통합을 가능하게 하여 재현 가능한 연구를 촉진하기 위해.
  • 다양한 연구 기관의 요구에 부합하는 클라우드 및 온프레미스 배포를 모두 지원하는 확장성 있고 모듈러한 플랫폼을 제공하기 위해.

제안 방법

  • 플랫폼 기능을 확장하기 위해 마이크로서비스 및 서버리스 함수를 활용한 모듈러하고 클라우드 네이티브 아키텍처를 구현하기 위해.
  • 사용자 정의 메타데이터 스키마와 그래프 기반 메타데이터 모델링을 지원하여 복잡한 데이터 관계와 의미적 연결을 가능하게 하기 위해.
  • 시간 시리즈, 영상, 게놈, 계산 모델 데이터를 위한 도메인 전용 데이터 뷰어를 통합하고 오버레이 주석 도구를 제공하기 위해.
  • 제3자 애플리케이션 통합 및 맞춤형 데이터 파이프라인 개발을 가능하게 하기 위해 포괄적인 RESTful API를 제공하기 위해.
  • 지속 가능한 DOI, 표준화된 메타데이터, 액세스 제어 및 기계 가공 가능한 데이터 기술을 통해 FAIR 원칙을 이행하기 위해.
  • 역할 기반 액세스 제어와 버전 관리된 데이터셋 출판 기능을 갖춘 협업 워크스페이스를 구현하여 재현 가능성과 감사 가능성을 확보하기 위해.

실험 결과

연구 질문

  • RQ1확장성 있고 클라우드 기반의 플랫폼은 대규모 다중 모달 신경과학 연구에서 데이터 통합과 협업을 어떻게 향상시킬 수 있는가?
  • RQ2FAIR 준수된 데이터 관리 시스템은 얼마나 효과적으로 데이터 사각지대를 줄이고 기관 간 데이터 재사용성을 향상시킬 수 있는가?
  • RQ3사용자 정의 가능한 메타데이터 및 주석 인프라는 다중 모달 데이터 탐색 및 분석을 가능하게 하는 데 어떤 역할을 하는가?
  • RQ4모듈러하고 API 중심의 아키텍처는 외부 과학 도구 및 워크플로우와의 확장성과 통합을 어떻게 지원하는가?
  • RQ5통합 플랫폼은 임상, 전임상, 계산 기반 연구를 포함한 다양한 신경과학 이니셔티브를 효과적으로 지원할 수 있는가?

주요 결과

  • Pennsieve는 총 125TB의 과학 데이터에 걸쳐 350개 이상의 공개 가능하고 고영향력 있는 데이터셋을 호스팅하고 있으며, 그 중 35TB는 공개 액세스가 가능합니다.
  • 플랫폼은 NIH SPARC, NIH HEAL PRECISION Human Pain Network, RE-JOIN을 포함한 주요 국가 연구 이니셔티브에 통합되어 있으며, 전 세계 80개 이상의 연구 그룹이 이를 활용하고 있습니다.
  • Pennsieve는 EEG, MEG, MRI, 현미경 영상, 유전자 발현, 3D 모델, 계산 시뮬레이션 등 다양한 데이터 모달리티를 지원합니다.
  • 버전 관리, 지속 가능한 DOI, 구조화된 메타데이터를 갖춘 피어리뷰된 데이터 출판을 지원하여 데이터셋의 재현성과 인용 가능성을 향상시킵니다.
  • 통합된 데이터 뷰어 및 주석 도구를 통해 사용자는 플랫폼 내에서 직접 시간 시리즈, 영상, 게놈 데이터를 시각화하고 주석을 달 수 있습니다.
  • Pennsieve는 NIH 승인 데이터 레포지토리로 인정받으며 FAIR 원칙을 준수하여 신경과학 데이터의 장기적인 검색 가능성, 접근 가능성, 재사용 가능성을 보장합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.