[論文レビュー] COVIDScholar: An automated COVID-19 research aggregation and analysis platform
COVIDScholar は、自然言語処理(NLP)を活用した自動化されたプラットフォームであり、疫学、物理学、社会科学、 humanity など多様な分野から 81,000 件を超える COVID-19 関連の科学的文書を、スケーラブルなデータパイプラインと検索インターフェースを用いて集約・分析する。研究者が急増する文献から実行可能なインサイトを発見できるようにし、ウェブポータルは週間で 2,000 人を超えるユニークユーザーを獲得しており、2020年4月に研究出力がピークに達したことが判明。特に精神保健および封鎖関連の研究が顕著に増加した。
The ongoing COVID-19 pandemic has had far-reaching effects throughout society, and science is no exception. The scale, speed, and breadth of the scientific community's COVID-19 response has lead to the emergence of new research literature on a remarkable scale -- as of October 2020, over 81,000 COVID-19 related scientific papers have been released, at a rate of over 250 per day. This has created a challenge to traditional methods of engagement with the research literature; the volume of new research is far beyond the ability of any human to read, and the urgency of response has lead to an increasingly prominent role for pre-print servers and a diffusion of relevant research across sources. These factors have created a need for new tools to change the way scientific literature is disseminated. COVIDScholar is a knowledge portal designed with the unique needs of the COVID-19 research community in mind, utilizing NLP to aid researchers in synthesizing the information spread across thousands of emergent research articles, patents, and clinical trials into actionable insights and new knowledge. The search interface for this corpus, https://covidscholar.org, now serves over 2000 unique users weekly. We present also an analysis of trends in COVID-19 research over the course of 2020.
研究の動機と目的
- 急激に拡大する COVID-19 科学文献における情報過多の課題に対処し、人的なレビューでは対応できない規模の文献を処理すること。
- プレプリントサーバー、学術雑誌、リポジトリに散在する研究を統合し、一元的で検索可能なコロレクションを構築すること。
- NLP を用いた分析により、物理学、公衆衛生、社会科学など多様な分野からの実行可能なインサイトを抽出できるようにすること。
- パンデミックの文脈を超えて応用可能な、スケーラブルで分野に依存しない科学文献集約インfraを構築すること。
提案手法
- arXiv、bioRxiv、medRxiv、CORD-19、LitCovid など 14 のオープンアクセスおよびプレプリントリポジトリから、自動的に新規出版物、特許、臨床試験をスクレイピング・インジェストする。
- DOI、PubMed ID、タイトルベースの照合を用いた重複除去パイプラインを適用し、同一文書の複数バージョンを1件の優先順位付きレコードに統合する。
- NLP モデルを用いて、COVID-19 との関連性、トピック、分野、分野分類を分類し、コロレクションを基にトレーニングされた階層的分類システムを採用する。
- pdfminer および必要に応じて OCR を用いて PDF から本文を解析するが、テキスト品質の制限により、NLP モデルへの利用はテキスト検索機能に限定される。
- Crossref からのメタデータ拡張と OpenCitations からの引用情報から、統合的で構造化されたコロレクションを構築する。
- https://covidscholar.org にウェブベースの検索ポータルをデプロイし、コロレクションをインデックス化し、研究者が意味的およびキーワードベースのクエリを実行できるようにする。
実験結果
リサーチクエスチョン
- RQ12020年1月から12月にかけて、COVID-19 関連研究文献の出力量と分野別分布はどのように変化したか?
- RQ2パンデミックの進行に伴い、特に社会科学および精神保健分野で、研究の主なテーマや注目分野にどのようなシフトが見られたか?
- RQ3科学コミュニティの研究出力が飽和状態に達したと見なせる程度はどの程度で、その時期はいつか?
- RQ4米国における景気刺激策やWHOのパンデミック宣言といった主要な政策的出来事は、研究出力の変化とどのように相関しているか?
- RQ5NLP テクニックは、パンデミック文脈における非構造的科学文献から潜在的な知識を効果的に同定・可視化できるか?
主な発見
- 2020年10月までに、14 のソースから 81,000 件を超える COVID-19 関連の科学的文書が収集され、2020年5月に月間出力が約 8,000 範文にピークに達した。
- 2020年4月に研究出力が完全に飽和状態に達し、その後も米国における景気刺激策(2020年3月)などの主要な政策的出来事があっても、出力の著しい増加は観察されなかった。
- 物理学および医学分野の論文割合は、1月の 5% および 15% から 4月に 8% および 20% に上昇し、研究の注目分野のシフトを示した。
- 精神保健および封鎖関連のトピックに関する文献の割合は、3月には 0% であったが、4月から6月にかけて 6–8% に上昇し、世界的な封鎖措置と一致した。
- 人文学および社会科学分野からの研究貢献は増加しており、特に広範な社会的距離の取り組みの開始に伴い、心理的影響に関する研究が増加した。
- プラットフォームは週間で 2,000 人を超えるユニークユーザーを獲得しており、科学コミュニティにおける高い採用率と実用性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。