[論文レビュー] Knowledge-tuning Large Language Models with Structured Medical Knowledge Bases for Reliable Response Generation in Chinese
本稿では、大規模言語モデル(LLM)に構造化された中国語医療知識ベースを統合することで、医療文脈における幻覚を低減し、応答の信頼性を向上させる知識チューニングという手法を提案する。知識ベースから医療QAペアを生成し、LLMをこの知識を検索・推論できるように微調整することで、少サンプルおよびゼロショット設定でも、特に新しく公開されたcMedKnowQAデータセットを用いた検証において、より高い事実的正確性と一貫性を達成した。
Large Language Models (LLMs) have demonstrated remarkable success in diverse natural language processing (NLP) tasks in general domains. However, LLMs sometimes generate responses with the hallucination about medical facts due to limited domain knowledge. Such shortcomings pose potential risks in the utilization of LLMs within medical contexts. To address this challenge, we propose knowledge-tuning, which leverages structured medical knowledge bases for the LLMs to grasp domain knowledge efficiently and facilitate reliable response generation. We also release cMedKnowQA, a Chinese medical knowledge question-answering dataset constructed from medical knowledge bases to assess the medical knowledge proficiency of LLMs. Experimental results show that the LLMs which are knowledge-tuned with cMedKnowQA, can exhibit higher levels of accuracy in response generation compared with vanilla instruction-tuning and offer a new reliable way for the domain adaptation of LLMs.
研究の動機と目的
- LLMが生成する医療応答における幻覚、特にドメイン特化された知識が不足している中国語文脈での幻覚を是正すること。
- LLMがトレーニング時および推論時において、構造化された医療知識ベースに効果的にアクセスし、推論できる手法を開発すること。
- LLMのパフォーランスをベンチマークするための高品質な中国語医療知識QAデータセット、cMedKnowQAを構築すること。
- 標準的な指標を超えて、知識チューニングされたLLMの信頼性、正確性、一般化能力を評価すること。
- 知識チューニングが応答品質を向上させるとともに、追跡可能な知識ソースを提供することで、医療AIアプリケーションにおける信頼性を高めることを実証すること。
提案手法
- 知識チューニングは、GPT-4を用いてプロンプトし、構造化された医療知識ベースから医療QAペアを生成することで構築する。
- この手法では、推論時に外部知識ベースから関連する医療事実を検索できるキーワードおよび属性(パrameters)を生成するようにLLMをトレーニングする。
- 推論時には、取得した知識を用いてLLMの応答を根拠づけ・精錬し、事実の整合性と追跡可能性を保証する。
- このアプローチは、応答生成中に外部検索モジュールとして機能するプラグイン型の医療知識関数を活用する。
- 包括的な指標スイート(知識検索の正確性、応答の有用性、無害性)を用いて、この手法を評価した。
- cMedKnowQAデータセットは、実際の医療知識ベースから構築されており、トレーニングおよび評価用に多様な医療エンティティと属性を含む。
実験結果
リサーチクエスチョン
- RQ1知識チューニングは、標準的なインstructチューニングと比較して、中国語のLLMが生成する医療応答における幻覚を顕著に低減できるか?
- RQ2限定的なデータで微調整された場合、知識チューニングは未観測の医療エンティティに対しても一般化できるか?
- RQ3構造化された医療知識ベースからの検索において、知識チューニングが応答の正確性と信頼性をどの程度向上させるか?
- RQ4追跡可能な知識ソースの統合が、LLMが生成する医療助言の信頼性と解釈可能性を向上させるか?
- RQ5ラベル付きデータが乏しい少サンプル状況でも、知識チューニングされたLLMは高いパフォーマンスを維持できるか?
主な発見
- cMedKnowQAデータセットの全量でトレーニングした知識チューニング済みLLMは、医療エンティティ生成で86.7%の正確性を達成し、知識検索および応答生成の両面で優れた性能を示した。
- 訓練データに含まれる固有の医療エンティティの最小0.05%でも、未観測エンティティへの一般化能力が強く保たれた。
- 少サンプル状況では、エンティティ生成の正確性が100件で60.1%から200件で80.7%に向上し、優れたサンプル効率性を示した。
- 知識チューニングされたモデルは、そのままのインstructチューニングモデルおよびベースラインLLMを上回り、幻覚的または余分な症状を含む応答が少ないことを確認した。
- 標準LLMと比較して、リファンピシンを胆道結石に対して推奨するといった、誤ったまたは根拠のない主張が顕著に減少した。
- 知識チューニングを施したモデルは、入力の医療知識に存在しない未検証の症状を追加しないなど、ソース知識とより一貫した応答を生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。