[論文レビュー] Automated Clinical Data Extraction with Knowledge Conditioned LLMs
本論文は、文脈内学習(ICL)を用いて動的に生成された内部知識を専門家が整備した外部知識と一致させる知識条件付き2段階型LLMフレームワークを提案し、臨床レポートからの肺病変データの自動抽出を実現する。既存のICL手法と比較して、主な分野(サイズ、縁、剛性)におけるF1スコアを12.9%向上させ、臨床NLP応用における正確性を向上させるとともに幻覚を低減する。
The extraction of lung lesion information from clinical and medical imaging reports is crucial for research on and clinical care of lung-related diseases. Large language models (LLMs) can be effective at interpreting unstructured text in reports, but they often hallucinate due to a lack of domain-specific knowledge, leading to reduced accuracy and posing challenges for use in clinical settings. To address this, we propose a novel framework that aligns generated internal knowledge with external knowledge through in-context learning (ICL). Our framework employs a retriever to identify relevant units of internal or external knowledge and a grader to evaluate the truthfulness and helpfulness of the retrieved internal-knowledge rules, to align and update the knowledge bases. Experiments with expert-curated test datasets demonstrate that this ICL approach can increase the F1 score for key fields (lesion size, margin and solidity) by an average of 12.9% over existing ICL methods.
研究の動機と目的
- ドメイン特化知識の欠如によるLLMベースの臨床データ抽出における幻覚と低精度の問題を解決すること。
- 非構造化レントゲンレポートから微細な肺病変特徴(例:縁、剛性)をより信頼性高く抽出すること。
- 自己生成された内部知識と権威ある外部医療知識を段階的に一致させるスケーラブルで反復的な手法を開発すること。
- 臨床研究およびレントゲン画像診断ワークフローにおける手作業の負担を軽減し、病変所見の構造的抽出を自動化すること。
提案手法
- 2段階プロセスを採用:まず肺病変所見を検出し、主要な構造化フィールドをパースングする。次に、非構造化病変記述テキストを詳細なフィールドにさらにパースングする。
- キュレートされた医療レポートコーパスから自動的に内部知識ベースを生成し、関連する参照を高レベルの抽出ルールに変換する。
- 検索モジュールは入力レポートに基づいて関連する内部知識ルールを選択し、スコアリングモジュールは外部専門家知識を用いてその真実性と有用性を評価する。
- 文脈内学習(ICL)により、取得済みかつスコアリング済みのルールをLLMに提示することで、抽出の正確性と一貫性を向上させる。
- 2段階目では制御語彙を活用し、複雑でネストされた病変記述を構造化フィールドに正確に変換する。
- 外部知識は、内部知識ベースの検証と更新にのみ使用され、コアアーキテクチャを変更せずに動的かつ継続的な改善が可能になる。

実験結果
リサーチクエスチョン
- RQ1動的に一致させた内部知識と外部知識を用いた文脈内学習(ICL)は、LLMベースの臨床データ抽出における幻覚を低減できるか?
- RQ2知識条件付きプロンプトは、縁や剛性のような微細な肺病変特徴の抽出正確性をどのように向上させるか?
- RQ3自己更新可能な内部知識ベースは、静的ICLまたはリtrieval-augmented generation(RAG)手法と比較して、臨床NLPタスクでどの程度優れているか?
- RQ42段階パースングアプローチは、エンドツーエンド手法と比較して、ネストされた複雑な病変記述の抽出をどの程度改善できるか?
- RQ5専門家が整備した外部知識の統合は、LLMが生成する臨床データ抽出の信頼性をどの程度向上させるか?
主な発見
- 提案されたフレームワークは、主な病変フィールド(病変サイズ、縁、剛性)のF1スコアを、既存のICL手法と比較して平均12.9%向上させた。
- 臨床的に重要な所見の検出において信頼性が向上し、LLM出力における幻覚が顕著に低減された。
- 2段階パースングアプローチにより、特殊なプロンプティングと制御語彙の適用によって、ネストされた病変記述フィールドの抽出がより正確に実現された。
- スコアリングモジュールは、微調整を行わず事前学習済みのままではあるが、取得した知識ルールの真実性と有用性を効果的に評価できた。
- システムのアーキテクチャにより、コアモデルを変更せずに更新済みまたは改善された外部知識ソースの統合が容易になった。
- 標準的なRAGおよびICLベースラインと比較して、特に複雑でドメイン特化された臨床的属性の抽出において優れた性能を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。