[論文レビュー] Nanopublications: A Growing Resource of Provenance-Centric Scientific Linked Data
本論文は、主にライフサイエンス分野から得られた、埋め込み型のプロバンセンスおよびメタデータを備えた、1000万件を超えるナノパブリケーション(原子的科学的主張)からなる、成長著しい、プロバンセンス中心のリンクドデータリソースを提示する。ナノパブリケーション形式により、暗号的に保護された不変のURIと分散型ホスティングを介して、検証可能で細粒度のデータ公開が可能となり、異種の生物学的データセットにわたる信頼性、再現可能性、および細粒度のクエリが実現される。
Nanopublications are a Linked Data format for scholarly data publishing that has received considerable uptake in the last few years. In contrast to the common Linked Data publishing practice, nanopublications work at the granular level of atomic information snippets and provide a consistent container format to attach provenance and metadata at this atomic level. While the nanopublications format is domain-independent, the datasets that have become available in this format are mostly from Life Science domains, including data about diseases, genes, proteins, drugs, biological pathways, and biotic interactions. More than 10 million such nanopublications have been published, which now form a valuable resource for studies on the domain level of the given Life Science domains as well as on the more technical levels of provenance modeling and heterogeneous Linked Data. We provide here an overview of this combined nanopublication dataset, show the results of some overarching analyses, and describe how it can be accessed and queried.
研究の動機と目的
- リンクドデータ環境において、科学的データのプロバンセンスを標準化され、信頼できる方法で発行・追跡するための手法の欠如に対処する。
- 細粒度の、原子的で暗号的に検証可能なデータ形式を提供することで、科学的データにおける信頼性と再現可能性を実現する。
- 原子的主張レベルでの科学的データの発行・アクセスを可能にする、恒久的で分散型かつスケーラブルなインfra構築を目的とする。
- 遺伝子、薬剤、経路、相互作用などの多様なライフサイエンスデータセットを統合し、一元化されたクエリ可能なナノパブリケーション知識ベースを構築する。
- 標準化された機械処理可能な形式を通じて、プロバンセンス、データラインレージ、異種のリンクドデータに対する高度な分析を支援する。
提案手法
- 科学的知識をナノパブリケーションとして表現する——名前付きグラフとしてのアサーション、プロバンセンス、出版情報の3つのRDFグラフを備えた自己完結型のRDFグラフ。
- 信頼性のあるURI(例えば、SHA-256に基づく暗号ハッシュ)を用いて、ナノパブリケーションの不変性と検証可能性を保証する。
- 9カ国にまたがる15のサーバーインスタンスを備えた分散型発行ネットワークを実装し、信頼性の高い恒久的なデータホスティングを実現する。
- 標準化されたパイプラインを用いて、さまざまなソース(例:WikiPathways、DrugBank、iNaturalist、Avian Diet Database)からデータを抽出・変換し、ナノパブリケーション形式に変換する。
- RDF三元組ストアとSPARQLエンドポイントを用いてナノパブリケーションを格納・公開し、プログラムによるアクセスとクエリを可能にする。
- PROVオントロジーを用いて、知識の導出方法(アサーションプロバンセンス)およびナノパブリケーションの作成方法(出版プロバンセンス)の両方をモデル化する。
実験結果
リサーチクエスチョン
- RQ1科学的データを、完全なプロバンセンスと検証可能な整合性を備えた原子的レベルでどのように発行できるか?
- RQ2ライフサイエンス分野において、ナノパブリケーションとして表現可能な科学的知識の規模と多様性はどの程度か?
- RQ3分散型で暗号的に保護されたインfraは、科学的データの恒久的でスケーラブルかつ信頼性のある発行を支えることができるか?
- RQ4ナノパブリケーションは、数十年にわたるデータ進化と複数のデータソースにわたる細粒度のラインレージ追跡をどのように可能にするか?
- RQ5ナノパブリケーションは、データプロバンセンスおよび異種のリンクドデータに対する高度な分析をどの程度サポートできるか?
主な発見
- 1000万件を超えるナノパブリケーションが発行され、大規模で恒久的かつ検証可能な原子的科学的主張の知識ベースが構築された。
- ナノパブリケーションインフラは、遺伝子-疾患関連、薬剤相互作用、生物学的経路、生物相互作用など、多様な分野のデータをサポートしている。
- 信頼性のあるURIの使用により、データの不変性が保証され、ユーザーが発行されたデータがその識別子と一致していることを暗号的に検証できる。
- 9カ国にまたがる15のインスタンスを備えた分散型発行ネットワークにより、ナノパブリケーション知識ベースの高い可用性とレジリエンスが確保された。
- 細粒度のプロバンセンス追跡が可能である。例えば、1962年の鳥の食事観察は1985年の出版物から派生し、2017年のソフトウェアツール経由で2018年にナノパブリケーションとして発行された。
- WikiPathways、DrugBank、Avian Diet Databaseなどの複数のデータセットをナノパブリケーション形式に統合した事例は、この形式の異種の科学的分野における相互運用性と再利用可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。