Skip to main content
QUICK REVIEW

[论文解读] Chem2Bio2RDF: A Linked Open Data Portal for Chemical Biology

Bin Chen, David Wild|arXiv (Cornell University)|Dec 21, 2010
Biomedical Text Mining and Ontologies参考文献 33被引用 5
一句话总结

Chem2Bio2RDF 是一个链接开放数据门户,将 25 个化学和生物数据集(如基因、化合物、药物、疾病和 PubMed 文献)整合到一个统一的 RDF 知识图中。通过利用 D2R Server 并扩展其功能,如提供 SPARQL 端点、分面浏览器、查询生成器和 Cytoscape 插件,该门户实现了语义集成与交互式探索,在三个药物发现用例中通过跨数据集链接与验证展示了其有效性。

ABSTRACT

The Chem2Bio2RDF portal is a Linked Open Data (LOD) portal for systems chemical biology aiming for facilitating drug discovery. It converts around 25 different datasets on genes, compounds, drugs, pathways, side effects, diseases, and MEDLINE/PubMed documents into RDF triples and links them to other LOD bubbles, such as Bio2RDF, LODD and DBPedia. The portal is based on D2R server and provides a SPARQL endpoint, but adds on few unique features like RDF faceted browser, user-friendly SPARQL query generator, MEDLINE/PubMed cross validation service, and Cytoscape visualization plugin. Three use cases demonstrate the functionality and usability of this portal.

研究动机与目标

  • 为解决化学生物学领域中的数据孤岛问题,通过整合多样化的生物和化学数据集,构建一个统一的、机器可读的知识图谱。
  • 实现基因、化合物、药物、通路、不良反应、疾病和 PubMed 文献等异构数据源的语义集成。
  • 通过用户友好的工具(如 SPARQL 查询生成器、分面浏览器和 Cytoscape 可视化插件)提升数据的可发现性和可用性。
  • 通过链接 Bio2RDF、DBpedia 和 LODD 等外部门户的数据,支持药物发现,提升数据溯源性和交叉引用能力。
  • 通过涉及跨数据集查询和生物洞察生成的真实用例,验证该门户的实用性。

提出的方法

  • 使用 D2R Server 将 25 个异构的化学生物学数据集转换为 RDF 三元组,实现机器可处理的表示。
  • 在 Chem2Bio2RDF 知识图谱与外部 LOD 云(包括 Bio2RDF、DBpedia 和 LODD)之间建立语义链接,以增强数据互联性。
  • 提供 SPARQL 端点,支持对 RDF 数据的程序化访问,实现对生物和化学实体的复杂查询。
  • 实现用户友好的 SPARQL 查询生成器,降低非专家用户执行语义查询的门槛。
  • 开发 RDF 分面浏览器,支持对数据图谱的交互式、分层式导航。
  • 集成 MEDLINE/PubMed 交叉验证服务,利用文献证据验证和丰富生物实体之间的关系。

实验结果

研究问题

  • RQ1如何将异构的化学和生物数据集语义集成到一个统一的、可查询的知识图谱中?
  • RQ2链接开放数据门户在系统化化学生物学领域在多大程度上能改善数据发现与集成?
  • RQ3用户友好的界面(如 SPARQL 查询生成器和分面浏览器)能否有效支持非技术研究人员探索复杂的生物数据?
  • RQ4与外部 LOD 源(如 DBpedia、Bio2RDF)进行交叉引用在多大程度上能提升数据质量和上下文信息?
  • RQ5该门户能否通过药物发现中的真实用例支持产生有意义的生物洞察?

主要发现

  • 该门户成功将 25 个多样化数据集发布并互联为一个统一的 RDF 知识图谱,支持对基因、化合物、药物、疾病和 PubMed 文献的跨数据集查询。
  • 与 Bio2RDF、DBpedia 和 LODD 等外部 LOD 云的集成显著扩展了数据上下文和溯源信息,提升了数据的实用性。
  • SPARQL 端点以及用户友好的工具(包括查询生成器和分面浏览器)使非专家用户能够高效且便捷地探索数据。
  • MEDLINE/PubMed 交叉验证服务为生物实体关系提供了基于证据的支持,增强了查询结果的可信度。
  • 三个真实用例展示了该门户在揭示生物相关关联方面的能力,如药物-疾病关联和化合物-通路相互作用。
  • Cytoscape 可视化插件支持交互式网络分析,使用户能够直观地探索和解释复杂的生物关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。