[論文レビュー] MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
本稿では、患者と医師の対話に類似した現実的な対話形式を再現するPatientシステムと、適応的なExpertシステムを備えた、臨床的推論におけるインタラクティブな質問提示を可能にするフレームワークMediQを紹介する。GPT-3.5 や Llama-3 といった最先端のLLMは、能動的な情報収集に苦労するが、自信推定のための新規な放棄モジュールを導入することで、診断精度が22.3%向上する。ただし、完全情報が事前に提供された基準と比べると依然として劣る。
Users typically engage with LLMs interactively, yet most existing benchmarks evaluate them in a static, single-turn format, posing reliability concerns in interactive scenarios. We identify a key obstacle towards reliability: LLMs are trained to answer any question, even with incomplete context or insufficient knowledge. In this paper, we propose to change the static paradigm to an interactive one, develop systems that proactively ask questions to gather more information and respond reliably, and introduce an benchmark - MediQ - to evaluate question-asking ability in LLMs. MediQ simulates clinical interactions consisting of a Patient System and an adaptive Expert System; with potentially incomplete initial information, the Expert refrains from making diagnostic decisions when unconfident, and instead elicits missing details via follow-up questions. We provide a pipeline to convert single-turn medical benchmarks into an interactive format. Our results show that directly prompting state-of-the-art LLMs to ask questions degrades performance, indicating that adapting LLMs to proactive information-seeking settings is nontrivial. We experiment with abstention strategies to better estimate model confidence and decide when to ask questions, improving diagnostic accuracy by 22.3%; however, performance still lags compared to an (unrealistic in practice) upper bound with complete information upfront. Further analyses show improved interactive performance with filtering irrelevant contexts and reformatting conversations. Overall, we introduce a novel problem towards LLM reliability, an interactive MediQ benchmark and a novel question-asking system, and highlight directions to extend LLMs' information-seeking abilities in critical domains.
研究の動機と目的
- 不完全な情報が与えられた際のLLMの信頼性の欠如を是正すること。
- 患者が不完全なデータを提供する現実的な医療相談を再現し、臨床医が能動的に欠落した情報を収集する必要がある状況を模擬すること。
- 静的で単一ターンのQAとは異なり、インタラクティブで複数ターンの臨床的推論を評価するベンチマークの開発。
- LLMが不確実性を感じた際に推測を避けてフォローアップ質問を投げかける方法が、どのように可能かを調査すること。
- 医療診断の過程で、信頼性があり適応的な情報収集に必要な能力に、現在のLLMが抱える主な課題と性能ギャップを特定すること。
提案手法
- MediQフレームワークは、患者を模倣するPatientシステムと、患者記録からの事実的記憶を用いてフォローアップ質問に回答する。
- Expertシステムは医師のアシスタントとして機能し、各ターンで自信に基づいて回答するか、さらなる情報を求めることを決定する。
- MedQAおよびCraft-MDを、初期段階で部分的な患者情報のみを提供するインタラクティブな設定に変換する。
- 新たな放棄モジュールを導入し、自信推定と、さらなる質問を求める意思決定を改善する。
- モデル構成の違いにかかわらず、信頼性と一貫性を評価するため、複数のプロンプトバリエーション(システムプロンプトおよび応答プロンプト)をテストする。
- 診断精度を、医学専門分野と質問の難易度レベルごとに評価し、完全情報の上界基準と比較する。

実験結果
リサーチクエスチョン
- RQ1最先端のLLMは、情報が不完全な状況で、フォローアップ質問を能動的に投げかけることで、信頼性のあるインタラクティブな臨床的推論に参加できるか?
- RQ2インタラクティブな臨床的推論におけるLLMのパフォーマンスは、完全情報が提供された単一ターンQAにおけるパフォーマンスと比べてどの程度異なるか?
- RQ3異なるプロンプト工学戦略(システムプロンプトおよび応答プロンプト)が、情報収集タスクにおけるLLMの信頼性と一貫性に与える影響は何か?
- RQ4医学的質問の難易度や専門分野の種別が、インタラクティブ情報収集の利点に与える影響は何か?
- RQ5自信推定やコンテキストフィルタリングといった、インタラクティブLLMの診断精度を顕著に向上させる要因として、どのようなコンponentsが最も顕著に寄与するか?
主な発見
- SOTA LLMに直接質問を求めるプロンプトを提示した場合、同じ制限付きコンテキスト下での単一ターン推論と比較して、診断精度が相対的に11.3%低下した。
- 自信に基づく放棄モジュールの導入により、データセット全体で診断精度が22.3%向上し、明確な不確実性の処理の価値が示された。
- 改善が見られたにもかかわらず、完全な情報が事前に提供された場合の上界基準と比べ、最高のインタラクティブExpertシステムでも依然として10.3%の差があった。
- 特に難易度の高い専門分野、例えば眼科分野では、対話による精度向上が顕著で、診断精度が18.2%から45.5%に上昇した。
- 推論の根拠を生成するプロンプト変種はわずかにパフォーマンスを向上させたが、回答のシャッフルは顕著な影響がなく、特定のバイアスに対して頑健であることが示された。
- 本研究では、LLMがコンテキストが不足している場合にパラメトリック知識に依存する傾向があることが明らかになった。その結果、最も一般的な選択肢との一致率が50.0%に達し、これが精度の低下を引き起こしている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。