Skip to main content
QUICK REVIEW

[논문 리뷰] The I-ADOPT Interoperability Framework for FAIRer data descriptions of biodiversity

Barbara Magagna, Ilaria Rosati|arXiv (Cornell University)|2021. 07. 14.
Biomedical Text Mining and Ontologies참고 문헌 11인용 수 6
한 줄 요약

I-ADOPT 프레임워크는 관측 가능한 성질을 기계로 읽을 수 있고 해석 가능한 IRI로 모델링함으로써 생물다양성 데이터 간의 의미적 상호운용성을 향상시키기 위해 표준화되고 FAIR 원칙에 부합하는 온톨로지를 제안한다. 변수 구성 요소인 성질, 관측 대상, 값에 대해 FAIR 준수 어휘로 매핑함으로써 일관되고 재사용 가능한 메타데이터와 RDF 기반의 데이터 표현을 가능하게 하여, GBIF, PANGAEA, eLTER RI와 같은 이질적인 생물다양성 인프라 간의 데이터 통합을 크게 향상시킨다.

ABSTRACT

Biodiversity, the variation within and between species and ecosystems, is essential for human well-being and the equilibrium of the planet. It is critical for the sustainable development of human society and is an important global challenge. Biodiversity research has become increasingly data-intensive and it deals with heterogeneous and distributed data made available by global and regional initiatives, such as GBIF, ILTER, LifeWatch, BODC, PANGAEA, and TERN, that apply different data management practices. In particular, a variety of metadata and semantic resources have been produced by these initiatives to describe biodiversity observations, introducing interoperability issues across data management systems. To address these challenges, the InteroperAble Descriptions of Observable Property Terminology WG (I-ADOPT WG) was formed by a group of international terminology providers and data center managers in 2019 with the aim to build a common approach to describe what is observed, measured, calculated, or derived. Based on an extensive analysis of existing semantic representations of variables, the WG has recently published the I-ADOPT framework ontology to facilitate interoperability between existing semantic resources and support the provision of machine-readable variable descriptions whose components are mapped to FAIR vocabulary terms. The I-ADOPT framework ontology defines a set of high level semantic components that can be used to describe a variety of patterns commonly found in scientific observations. This contribution will focus on how the I-ADOPT framework can be applied to represent variables commonly used in the biodiversity domain.

연구 동기 및 목표

  • GBIF, ILTER, BODC와 같은 글로벌 이니셔티브에서 생기고 있는 이질적인 메타데이터와 의미 자원으로 인한 생물다양성 데이터의 상호운용성 문제 해결.
  • 생물다양성 관측에서 관측되거나 측정되거나 유도된 바를 기술하기 위한 공통 프레임워크를 통해 다양한 용어와 데이터 관리 관행 통합.
  • 특히 검색 가능성과 상호운용성에 중점을 두고, 변수 개념에 대해 기계로 읽을 수 있고 해석 가능한 식별자(URI)를 제공함으로써 FAIR 데이터 원칙을 발전시킴.
  • 연구 인프라 간 생물다양성 데이터 통합을 지원하기 위해 변수 기술을 표준화되고 재사용 가능한 의미적 구성 요소와 일치시킴.
  • OBOE 및 DDI-CDI와 같은 기존 모델에 대한 매핑과 설계 패턴을 제공함으로써 다양한 시스템에서의 도입을 촉진함.

제안 방법

  • 변수를 핵심 의미적 구성 요소로 분해하는 고수준 온톨로지를 개발: 성질(관측되는 것), 관측 대상(관측되는 것), 값(결과).
  • 이러한 구성 요소들을 지속적이고 해석 가능한 식별자(IRI)로 매핑하여 메타데이터 필드에서 일반 텍스트를 대체함으로써 기계 가독성을 향상시킴.
  • 실제 생물다양성 데이터에 프레임워크를 적용하기 위해 SKOS 어휘(예: LifeWatch Phytotraits, EnvThes)와 RDF 데이터 모델을 사용하여 구조화되고 질의 가능한 표현 방식을 구현함.
  • EML 2.2.0 및 다윈 코어와 같은 기존 메타데이터 표준에 통합하여 스프레드시트 및 공식 지식 표현 형식에서의 사용 가능성을 확보함.
  • RDF 삼항관계에 IRI를 통합함으로써 SPARQL 기반의 필터링 가능한 검색을 가능하게 하여 사용자가 특정 물질(예: 엔도설파이트) 또는 생물(예: Ostrea edulis)을 기반으로 데이터셋을 질의할 수 있도록 함.
  • OBOE 및 DDI-CDI와 같은 외부 모델에 대한 매핑을 수립하여 다양한 데이터 관리 생태계에서의 호환성과 광범위한 도입 가능성을 확보함.

실험 결과

연구 질문

  • RQ1이질적인 생물다양성 데이터 인프라 간의 의미적 상호운용성을 어떻게 향상시킬 수 있는가? 이는 메타데이터 및 용어 관행의 다양성으로 인해 발생하는 문제를 바탕으로 한다.
  • RQ2어떤 표준화되고 재사용 가능한 구성 요소를 사용하여 생물다양성 관측에서 관측 가능한 성질을 기계로 읽을 수 있고 FAIR 원칙에 부합하는 방식으로 기술할 수 있는가?
  • RQ3기존 메타데이터 표준(예: 다윈 코어, EML)은 IRI 기반 변수 기술로 얼마나 향상될 수 있는가? 이는 데이터 통합을 향상시키는 데 기여하는가?
  • RQ4세포 형태나 정착 정도와 같은 정성적 관측 변수는 어떻게 의미적으로 모델링하고 제어된 어휘 및 IRI를 사용하여 인코딩할 수 있는가?
  • RQ5eLTER RI, PANGAEA, GBIF와 같은 주요 생물다양성 데이터 시스템에서 I-ADOPT 프레임워크를 도입하기 위한 실용적인 길은 무엇인가?

주요 결과

  • I-ADOPT 프레임워크는 성질, 관측 대상, 값의 세 가지 핵심 구성 요소를 사용하여 일관되고 기계로 읽을 수 있는 기술을 가능하게 함.
  • 일반 텍스트 대신 지속 가능한 IRI로 변수 개념을 매핑함으로써 메타데이터의 검색 가능성과 상호운용성이 크게 향상되며, 특히 RDF 기반 데이터 배포에서 두드러진다.
  • RDF 삼항관계에 IRI를 통합함으로써 사용자가 특정 물질(예: 엔도설파이트) 또는 생물(예: Ostrea edulis)을 기반으로 데이터셋을 질의할 수 있는 SPARQL 기반의 질의 기능을 제공함.
  • LifeWatch 이태리 및 eLTER RI에서의 개념 증명 구현 사례는 SKOS 기반 어휘가 기능적 특성 및 표준 관측에 대한 IRI 연결된 변수 정의로 확장될 수 있음을 입증함.
  • 예: 생물체 내 물질 농도와 같은 변수에 대한 설계 패턴을 제공함으로써 다양한 연구 맥락에서 일관된 모델링이 가능해지고 영역 간 재사용을 지원함.
  • OBOE 및 DDI-CDI와 같은 기존 모델에 대한 매핑 가능성은 프레임워크가 더 넓은 데이터 통합 생태계에서 의미적 상호운용성을 향상시킬 잠재력을 확인함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.