[論文レビュー] Building a PubMed knowledge graph
本論文は、PubMed、NIH ExPORTER、ORCID、MapAffilなどの複数のデータソースから得たバイオエンティティ、著者名の曖昧さ解消、資金情報、所属履歴を統合することで、PubMed知識グラフ(PKG)の構築を提示している。BioBERTを用いたエンティティ抽出と高度な曖昧さ解消技術を適用し、著者名の曓昧さ解消で98.09%のF1スコアを達成し、従来のモデルを著しく上回るバイオエンティティ認識性能を実現した。
PubMed is an essential resource for the medical domain, but useful concepts are either difficult to extract or are ambiguated, which has significantly hindered knowledge discovery. To address this issue, we constructed a PubMed knowledge graph (PKG) by extracting bio-entities from 29 million PubMed abstracts, disambiguating author names, integrating funding data through the National Institutes of Health (NIH) ExPORTER, collecting affiliation history and educational background of authors from ORCID, and identifying fine-grained affiliation data from MapAffil. Through the integration of the credible multi-source data, we could create connections among the bio-entities, authors, articles, affiliations, and funding. Data validation revealed that the BioBERT deep learning method of bio-entity extraction significantly outperformed the state-of-the-art models based on the F1 score (by 0.51%), with the author name disambiguation (AND) achieving a F1 score of 98.09%. PKG can trigger broader innovations, not only enabling us to measure scholarly impact, knowledge usage, and knowledge transfer, but also assisting us in profiling authors and organizations based on their connections with bio-entities. The PKG is freely available on Figshare (https://figshare.com/s/6327a55355fc2c99f3a2, simplified version that exclude PubMed raw data) and TACC website (http://er.tacc.utexas.edu/datasets/ped, full version).
研究の動機と目的
- PubMedの要約から有用な生物医学的概念を抽出・曇摩解消する課題に対処すること。
- バイオエンティティ、著者名、資金、所属、教育背景といった複数のデータソースを統合し、統一された知識グラフに統合すること。
- 最先端のモデルを上回る精度でバイオエンティティ抽出と著者名の曇摩解消を向上させること。
- 学術的インパacts測定、知識移転分析、著者および機関のプロファイリングといった新たな分析能力を可能にすること。
- 生物医学研究および知識発見のための自由に利用可能な包括的リソースを提供すること。
提案手法
- 2900万件のPubMed要約から、深層学習モデルであるBioBERTを用いてバイオエンティティを抽出した。
- 高精度・高再現率を達成する多段階の曇摩解消パイプラインを適用し、著者名の曇摩を解消した。
- NIH ExPORTERデータベースから資金情報を統合し、助成金と出版物・著者を関連付けた。
- ORCIDおよびMapAffilから得た著者の所属履歴および教育背景を収集・構造化した。
- バイオエンティティ、著者、論文、所属、資金の間の意味的関係を含む統一知識グラフにすべてのデータソースを統合した。
- ベンチマークデータセットを用いた検証と、既存モデルとのF1スコア比較により、知識グラフの妥当性を確認した。
実験結果
リサーチクエスチョン
- RQ1ディープラーニングベースのバイオエンティティ抽出は、既存の最先端モデルを上回る性能を示せるか?
- RQ2統合された複数のデータソースを用いることで、著者名の曇摩解消はどの程度向上できるか?
- RQ3知識グラフは、多様な生物医学的データソースを一貫性があり照会可能な構造に効果的に統合できるか?
- RQ4PubMed、ORCID、NIHデータを統合することで、エンティティ抽出および曇摩解消の性能向上はどの程度達成できるか?
- RQ5得られた知識グラフは、学術的インパacts分析および知識移転研究をどの程度支援できるか?
主な発見
- BioBERTベースのバイオエンティティ抽出手法は、最先端モデルを0.51%上回るF1スコアを達成した。
- 著者名の曇摩解消は98.09%という高いF1スコアに達し、曇摩のある著者識別を強力に解消できることを示した。
- NIH資金、ORCIDの所属情報、MapAffilデータを統合することで、知識グラフ内に豊富で意味的に接続された関係が実現された。
- PubMed知識グラフ(PKG)は、学術的インパクト測定、知識利用、機関間の知識移転分析の新たな分析能力を可能にした。
- PKGは2つのバージョンで公開されている:Figshareに簡易版、TACCウェブサイトにフルバージョン。
- データ検証により、大規模な生物医学文献を対象とした知識グラフ構築パイプラインの信頼性とスケーラビリティが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。