[論文レビュー] Exploring the In-context Learning Ability of Large Language Model for Biomedical Concept Linking
本稿では、密度的な検索 followed 後続のLLMベースの再順序付けを用いる2段階の文脈内学習(ICL)フレームワークを提案し、微調整やラベル付きデータを一切使用せずに、疾患正規化で90.1%、化学物質正規化で94.7%の精度を達成した。これは教師あり手法と同等の性能を示す。
The biomedical field relies heavily on concept linking in various areas such as literature mining, graph alignment, information retrieval, question-answering, data, and knowledge integration. Although large language models (LLMs) have made significant strides in many natural language processing tasks, their effectiveness in biomedical concept mapping is yet to be fully explored. This research investigates a method that exploits the in-context learning (ICL) capabilities of large models for biomedical concept linking. The proposed approach adopts a two-stage retrieve-and-rank framework. Initially, biomedical concepts are embedded using language models, and then embedding similarity is utilized to retrieve the top candidates. These candidates' contextual information is subsequently incorporated into the prompt and processed by a large language model to re-rank the concepts. This approach achieved an accuracy of 90.% in BC5CDR disease entity normalization and 94.7% in chemical entity normalization, exhibiting a competitive performance relative to supervised learning methods. Further, it showed a significant improvement, with an over 20-point absolute increase in F1 score on an oncology matching dataset. Extensive qualitative assessments were conducted, and the benefits and potential shortcomings of using large language models within the biomedical domain were discussed. were discussed.
研究の動機と目的
- 高コストなアノテーション、データの有効期限切れ、タスク間での一般化性の低さといった、教師あり手法の限界を是正すること。
- 大規模言語モデル(LLM)における文脈内学習(ICL)が、タスク固有の微調整なしにゼロショットで柔軟にバイオメディカル概念リンクを可能にするかを検討すること。
- 曖昧さ、希少疾患、異種のデータソースに対応できる一般化され、堅牢な概念リンクフレームワークの開発。
- LLMのバイオメディカルリンクタスクにおける解釈可能性と推論品質を評価すること、特に複雑または希少な疾患サブタイプにおいて。
- 実世界のバイオメディカルデータセットを用いた、閉鎖型(GPT-4)およびオープンソース型(Llama)モデルにおけるLLMベースのリンクの実現可能性と性能を評価すること。
提案手法
- 2段階のフレームワークを採用:まず、言語モデルから得られる密度的ベクトル埋め込みを用いて候補となるバイオメディカル概念を検索する。
- 埋め込み類似度を計算し、各テキスト表記に対して上位-kの候補概念を特定する。
- 各候補概念の文脈と元の表記を組み合わせて、LLM入力に用いる文脈内学習プロンプトを構築する。
- LLM(例:GPT-4 や Llama)を用いて、文脈的関連性と意味的整合性に基づき候補を再順序付ける。
- LLMの文脈内学習機能を活用し、モデルの微調整なしにゼロショット推論を実現する。
- 概念の説明や省略語辞書などの外部知識を統合し、希少または曖昧なエンティティの性能向上を図る。

実験結果
リサーチクエスチョン
- RQ1LLMにおける文脈内学習が、微調整やラベル付きデータなしに、バイオメディカル概念リンクを効果的に実行できるか?
- RQ2GPT-4 や Llama といったLLMの性能は、疾患および化学物質エンティティ正規化タスクにおいて、教師あり手法と比べてどの程度優れているか?
- RQ3LLMの概念リンクにおける推論プロセスが、表面的なキーワードマッチングではなく、正確で文脈に適った論理的思考を反映しているか?
- RQ4希少疾患や曖昧な省略語に対して、LLMベースの概念リンクの主な失敗モードは何か?
- RQ5外部知識(例:説明文、省略語リスト)の統合が、LLMベースのリンクの堅牢性と正確性に与える影響は何か?
主な発見
- 提案されたICLベースのフレームワークは、BC5CDR疾患エンティティ正規化で90.1%のF1スコア、化学物質エンティティ正規化で94.7%のF1スコアを達成し、ベースラインのゼロショット手法を上回り、教師ありベースラインに近い性能を示した。
- 腫瘍学マッチングデータセットでは、ベースライン手法と比較してF1スコアが20ポイント以上上昇し、優れた一般化性能と堅牢性を示した。
- GPT-4は希少疾患サブタイプや複雑な概念記述において優れた推論力と正確性を示したが、Llama 13Bは正確性と論理的一致性の両面で困難を示した。
- GPT-4の推論プロセスは一般的に提供された文脈や説明と整合的であり、解釈可能性が向上した。一方、Llamaは正しく予測したにもかかわらず、誤った推論を生成することがあった。
- 複数の概念が同じ名前を持つ場合や、省略語が曖昧な場合に、フレームワークは失敗を示した。外部知識統合の必要性が示された。
- GPT-4を用いた推論は高コスト(3,700ペアで150ドル)であり、Llama 13BのようなローカルLLMですら遅かった(103 ms/token)。これにより、広範な導入におけるスケーラビリティとハードウェア制約が浮き彫りになった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。