[論文レビュー] OpenExtract: Automated Data Extraction for Systematic Reviews in Health
OpenExtractは、ヘルス系の系統的レビューのデータを自動抽出するオープンソースパイプラインで、ヒト研究者と比較して精度と再現率が0.8を超える。
This study presents OpenExtract, an open-source pipeline for automated data extraction in large-scale systematic literature reviews. The pipeline queries large language models (LLMs) to predict data entries based on relevant sections of scientific articles. To test the efficacy of OpenExtract, we apply it to a systematic literature review in digital health and compare its outputs with those of human researchers. OpenExtract achieves precision and recall scores of > 0.8 in this task, indicating that it can be effective at extracting data automatically and efficiently. OpenExtract: https://github.com/JimAchterbergLUMC/OpenExtract.
研究の動機と目的
- ヘルス系系統的レビューにおけるデータ抽出のスケーラビリティの必要性を動機づける。
- LLMを用いてデータ抽出を自動化するオープンソースパイプラインを提案する。
- デジタルヘルス系統的レビューにおいてOpenExtractを人間研究者と比較評価する。
提案手法
- OpenExtractは関連する論文セクションからデータ項目を予測するために大規模言語モデルを照会する。
- パイプラインは研究者が通常行うデータ抽出作業を自動化する。
- デジタルヘルス系統的レビューを用いた人間研究者との比較評価。
実験結果
リサーチクエスチョン
- RQ1LLMsを用いてヘルス系統的レビューの predefined データ項目を自動的に正確に抽出できるか。
- RQ2ヘルス文献におけるデータ抽出タスクにおいて、OpenExtractは精度と再現率の点で人間研究者とどう比較されるか。
- RQ3オープンソースのアプローチは大規模な系統的レビューに対して有効か。
主な発見
- OpenExtractはデジタルヘルス系統的レビューのデータ項目抽出で精度と再現率が > 0.8 を達成する。
- パイプラインは人間研究者と同等のデータ抽出出力を生み出す効率を示す。
- 本研究はヘルス分野の大規模系統的レビューに対する実用的な自動化ツールとしてOpenExtractを検証する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。