[論文レビュー] PMC text mining subset in BioC: 2.3 million full text articles and growing
本稿では、PubMed Central (PMC) から抽出した230万件のフルテキスト生物学的医療関連論文のテキストマイニング用サブセットを、大規模かつ公開可能な形で提示する。このデータセットは、情報抽出を効率的に行うためにBioC形式に変換されている。データセットはFTPおよびWeb APIを介して利用可能であり、研究者が構造化されたアノテーションを備えたフルテキスト論文を容易にアクセス・分析でき、生物学的医療分野のテキストマイニング研究を著しく前進させる。
Interest in full text mining biomedical research articles is growing. NCBI provides the PMC Open Access and Author Manuscript sets of articles which are available for text mining. We have made all of these articles available in BioC, an XML and JSON format which is convenient for sharing text, annotations, and relations. These articles are available both via ftp for bulk download and via a Web API for updates or more focused collection. Availability: https://www.ncbi.nlm.nih.gov/research/bionlp/APIs/BioC-PMC/
研究の動機と目的
- テキストマイニング応用に向けた大規模かつアクセス可能なフルテキスト生物学的医療関連論文の需要に対応する。
- 研究コミュニティ間でのテキスト、アノテーション、関係性の共有を円滑にするために、標準化された機械可読形式(BioC)を提供する。
- スケーラブルな配布手法を用いて、フルPMCオープンアクセスおよび著者原稿コレクションへの効率的なアクセスを実現する。
- 包括的かつ最新のデータセットを提供することで、研究者がテキストマイニングシステムの構築およびトレーニングを支援する。
- バッチダウンロードとプログラムによるアクセスを可能にするWeb APIを用いて、動的データ取得および更新を可能にする。
提案手法
- NCBI PMCオープンアクセスおよび著者原稿コレクションに含まれるすべてのフルテキスト論文を収集した。
- 各論文を、テキスト、アノテーション、関係性の構造的表現をサポートするBioC形式に変換した。
- 大規模なオフライン処理を可能にするために、FTPを介してデータセットを提供した。
- オンデマンドアクセスおよび段階的更新を支援するため、Web APIを実装した。
- デジタル図書館のための確立されたBioC標準に準拠することで、データの一貫性および相互運用性を確保した。
- 再現可能性および長期的利用可能性を支援するため、バージョン管理およびメタデータ追跡を維持した。
実験結果
リサーチクエスチョン
- RQ1どのようにして、テキストマイニングに適した標準化された機械可読形式で、フルテキスト生物学的医療関連論文を効率的に提供できるか?
- RQ2バッチ解析からリアルタイムデータ取得まで多様な研究ニーズを満たすために、どのスケーラブルな配布メカニズムが最適か?
- RQ3事前に変換され、アノテーションが付与されたデータセットを提供することで、生物学的医療分野のテキストマイニング研究への参入障壁はどの程度低下するか?
- RQ4PMC論文をBioC形式に統合することで、テキストマイニングツールおよびシステム間の相互運用性はどのように向上するか?
- RQ5大規模な生物学的医療テキストデータセットへのアクセスにおいて、Web APIとFTPの間で生じるパフォーマンスおよび使いやすさのトレードオフは何か?
主な発見
- データセットは230万件のフルテキスト生物学的医療関連論文を含み、生命科学分野で最も大規模な公開可能なテキストマイニングリソースの一つである。
- 全コレクションがBioC形式で提供されており、後続の分析に向けたテキスト、アノテーション、関係性への構造的アクセスが可能である。
- データセットは、バッチダウンロード用のFTPおよびオンデマンドおよび段階的アクセス用のWeb APIの両方で配布されている。
- 標準化された形式でのデータセットの提供により、フルテキスト論文をテキストマイニングパイプライン用に準備する作業が著しく軽減された。
- データセットは継続的な更新および拡張をサポートしており、進化する研究ニーズに応じた長期的関連性と利用可能性を確保している。
- PMC論文のBioCエコシステムへの統合により、既存のテキストマイニングツールおよびフレームワークとの相互運用性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。