Skip to main content
QUICK REVIEW

[논문 리뷰] Exposing Provenance Metadata Using Different RDF Models

Gang Fu, Evan Bolton|Research Publications (Maastricht University)|2015. 09. 09.
Scientific Computing and Data Management인용 수 5
한 줄 요약

이 논문은 생명과학 관계와 그 증거 메타데이터를 표현하기 위해 다섯 가지 RDF 증거 모델—N-ary, 싱글턴 속성, 나노공개물, 그리고 그들의 기수 진술 변형 모델—을 평가한다. 화학물질-유전자-질병 관계의 대규모 통합 데이터셋을 사용하여, 기수 진술이 중복 삼항관계를 제거함으로써 쿼리 실행 시간을 크게 감소시킴을 입증한다. 그러나 최적의 성능는 RDF 스토어에 따라 달라지며, 이는 시스템 간에 유일한 최적 모델이 존재하지 않음을 시사한다.

ABSTRACT

A standard model for exposing structured provenance metadata of scientific assertions on the Semantic Web would increase interoperability, discoverability, reliability, as well as reproducibility for scientific discourse and evidence-based knowledge discovery. Several Resource Description Framework (RDF) models have been proposed to track provenance. However, provenance metadata may not only be verbose, but also significantly redundant. Therefore, an appropriate RDF provenance model should be efficient for publishing, querying, and reasoning over Linked Data. In the present work, we have collected millions of pairwise relations between chemicals, genes, and diseases from multiple data sources, and demonstrated the extent of redundancy of provenance information in the life science domain. We also evaluated the suitability of several RDF provenance models for this crowdsourced data set, including the N-ary model, the Singleton Property model, and the Nanopublication model. We examined query performance against three commonly used large RDF stores, including Virtuoso, Stardog, and Blazegraph. Our experiments demonstrate that query performance depends on both RDF store as well as the RDF provenance model.

연구 동기 및 목표

  • 생명과학 지식 그래프에서 다양한 RDF 증거 모델이 쿼리 성능와 그래프 크기에 미치는 영향을 평가하기 위해.
  • 수백만 개의 쌍방향 관계를 포함한 통합 생물의학 데이터셋에서 증거 메타데이터의 중복 문제를 해결하기 위해.
  • 기수 진술 모델이 증거 기반 가설 생성에서 계산 오버헤드를 줄일 수 있는지 평가하기 위해.
  • 세 가지 주요 RDF 스토어에서 N-ary, 싱글턴 속성, 나노공개물 모델이 기수 진술을 포함하거나 포함하지 않을 경우의 성능을 비교하기 위해.
  • 생물의학 연구 분야에서 의미 웹을 위한 표준화되고 효율적이며 상호운용 가능한 증거 모델 설계에 정보를 제공하기 위해.

제안 방법

  • 표준화된 식별자(CIDs, GIDs, UMLS CUIs)를 사용하여 14개의 생명과학 데이터베이스에서 화학물질, 유전자, 질병 간의 150만 개의 쌍방향 관계를 수집하고 정규화하였다.
  • 다섯 가지 RDF 증거 모델을 구현: N-ary, 싱글턴 속성, 나노공개물 모델을 기수 진술이 있는 경우와 없는 경우로 나누어, cito:providesAssertionFor를 사용하여 진술을 증거에 연결하였다.
  • 각 모델에 대해 RDF 그래프를 생성하고, Virtuoso, Stardog, Blazegraph 세 가지 RDF 스토어에서 그래프 크기와 쿼리 실행 시간을 측정하였다.
  • 성능 평가를 위해 증거와 관계 탐색의 다양한 측면을 대상으로 하는 네 가지 SPARQL 쿼리(Q1–Q4)를 설계하였다.
  • 모델과 스토어 간 평균 실행 시간과 표준편차를 비교하기 위해 통계 분석을 수행하였으며, 기수 진술이 있는지 여부에 따른 성능 차이에 집중하였다.
Figure 1: Graphical representation of N-ary model for the relation between compound CID5743 and gene 2908: (a) with cardinal assertion (Model I); (b) without cardinal assertion (Model II).
Figure 1: Graphical representation of N-ary model for the relation between compound CID5743 and gene 2908: (a) with cardinal assertion (Model I); (b) without cardinal assertion (Model II).

실험 결과

연구 질문

  • RQ1기수 진술의 포함 여부가 생명과학 데이터셋에서 증거 메타데이터를 표현하는 RDF 그래프 크기에 미치는 영향는 어떠한가?
  • RQ2N-ary, 싱글턴 속성, 나노공개물 중 어느 RDF 증거 모델이 다양한 RDF 스토어에서 가장 뛰어난 쿼리 성능을 제공하는가?
  • RQ3증거 메타데이터의 중복이 대규모 생물의학 지식 그래프에서 쿼리 실행 시간에 얼마나 큰 영향을 미치는가?
  • RQ4기수 진술의 성능 이점은 다양한 RDF 스토어 시스템(Virtuoso, Stardog, Blazegraph) 간에 달라지는가?
  • RQ5표준화되고 중복이 없는 증거 모델이 증거 기반 지식 탐색의 확장성과 효율성을 향상시킬 수 있는가?

주요 결과

  • 기수 진술이 없는 N-ary 모델은 가장 낮은 쿼리 성능를 보였으며, Virtuoso에서 Q1은 269.854 ± 99.266 초가 걸렸지만, 기수 진술 변형 모델(MODEL III)은 이 시간을 0.665 ± 0.263 초로 줄였다.
  • Blazegraph에서 나노공개물 모델(MODEL V)은 Q4에 대해 평균 쿼리 시간 0.732 ± 0.133 초를 기록하여, N-ary 모델(83.384 ± 1.612 초)보다 뚜렷이 빠른 성능을 보였다.
  • Q3에 대해선 기수 진술이 있는 SP 모델(MODEL IV)이 Blazegraph에서 가장 빠른 성능(0.465 ± 0.054 초)을 기록했고, 기수 진술이 있는 N-ary 모델(MODEL III)은 Virtuoso에서 가장 빠른 성능(3.075 ± 0.243 초)을 기록했다.
  • 기수 진술 모델은 특히 콘주너티브 쿼리에서 카티esian 곱 연산을 수행할 때 중복 삼항관계를 제거함으로써 그래프 탐색의 계산 오버헤드를 줄였다.
  • RDF 스토어에 따라 성능 차이가 뚜렷하게 나타났다: Virtuoso는 나노공개물 모델을 선호했고, Stardog는 기수 진술이 있는 SP 모델을 선호했으며, Blazegraph는 나노공개물 모델에서 가장 뛰어난 성능을 보였다.
  • 성능 차이가 있었음에도 불구하고, 증거 제약 조건이 적용된 경우 기수 진술이 있는지 여부에 관계없이 모델 간 성능가 유사했으며, 이는 기수 진술이 필터링되지 않은 또는 광범위한 검색 시나리오에서 가장 유익하다는 것을 시사한다.
Figure 2: Graphical representation of SP model for the relation between compound CID5743 and gene 2908: (a) with cardinal assertion (Model III); (b) without cardinal assertion (Model IV).
Figure 2: Graphical representation of SP model for the relation between compound CID5743 and gene 2908: (a) with cardinal assertion (Model III); (b) without cardinal assertion (Model IV).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.