QUICK REVIEW
[论文解读] Evaluation of AI Chatbots for Patient-Specific EHR Questions
Alaleh Hamidi, Kirk Roberts|arXiv (Cornell University)|Jun 5, 2023
Artificial Intelligence in Healthcare and Education被引用 8
一句话总结
该论文在去标识化的 MIMIC-III 入院记录的患者特定问答上评估了 ChatGPT 3.5、Claude 等大语言模型,发现它们能够提供准确、相关、全面且连贯的回答,但在更广泛的验证和连贯性改进方面仍需进一步工作。
ABSTRACT
This paper investigates the use of artificial intelligence chatbots for patient-specific question answering (QA) from clinical notes using several large language model (LLM) based systems: ChatGPT (versions 3.5 and 4), Google Bard, and Claude. We evaluate the accuracy, relevance, comprehensiveness, and coherence of the answers generated by each model using a 5-point Likert scale on a set of patient-specific questions.
研究动机与目标
- 使用临床笔记来回答患者特定问题,以提高电子病历信息的可获取性。
- 评估聊天机器人生成的患者特定问题答案的准确性、相关性、全面性和连贯性。
- 在标准化评估框架下比较不同提示场景与问题类型的表现。
提出的方法
- 使用公开的 MIMIC-III 子集(TREC CDS 2016)的入院记录作为来源笔记。
- 为每条笔记创建三类问题类别(一般性、具体性、不可回答),每类各5道问题。
- 测试两种会话场景:每次会话1个问题(1QpS)和每次会话1个主题(1TpS)。
- 由人工评估者以4个标准(准确性、相关性、覆盖范围、连贯性)在1–5分刻度对聊天机器人回答进行评估。
- 应用 Kruskal-Wallis 检验来评估会话类型、问题类型和模型之间的统计差异。
实验结果
研究问题
- RQ1LLM 基于聊天机器人是否能够准确回答来自临床笔记的患者特定问题?
- RQ2不同会话设置(1QpS 与 1TpS)如何影响答案质量?
- RQ3问题类型(一般、具体、不可回答)对准确性、相关性、覆盖范围和连贯性有何影响?
- RQ4不同模型(ChatGPT 3.5/4、Claude、Bard)在此任务上是否表现有差异?
- RQ5评估指标与样本量对结果的稳健性如何?
主要发现
- ChatGPT 3.5 和 Claude 在所有问题类型和场景中均给出准确、相关、全面且连贯的答案。
- Kruskal-Wallis 检验显示按会话场景、问题类型或 AI 模型没有统计学显著差异(p>0.05)。
- 在 General、Specific 和 Non-answerable 问题的 1QpS 和 1TpS 场景下,平均准确性、相关性、覆盖范围和连贯性均保持较高水平(具体数值在研究表中给出)。
- 研究使用的数据集较小,且评估由单一评审进行,存在潜在偏差,需要更广泛的验证。
- 结果表明大语言模型在临床笔记的患者特定问答方面具有潜力,但需要进一步工作以改进全面性和连贯性,并评估更多模型与更大数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。