Skip to main content
QUICK REVIEW

[论文解读] Evaluation of AI Chatbots for Patient-Specific EHR Questions

Alaleh Hamidi, Kirk Roberts|arXiv (Cornell University)|Jun 5, 2023
Artificial Intelligence in Healthcare and Education被引用 8
一句话总结

该论文在去标识化的 MIMIC-III 入院记录的患者特定问答上评估了 ChatGPT 3.5、Claude 等大语言模型,发现它们能够提供准确、相关、全面且连贯的回答,但在更广泛的验证和连贯性改进方面仍需进一步工作。

ABSTRACT

This paper investigates the use of artificial intelligence chatbots for patient-specific question answering (QA) from clinical notes using several large language model (LLM) based systems: ChatGPT (versions 3.5 and 4), Google Bard, and Claude. We evaluate the accuracy, relevance, comprehensiveness, and coherence of the answers generated by each model using a 5-point Likert scale on a set of patient-specific questions.

研究动机与目标

  • 使用临床笔记来回答患者特定问题,以提高电子病历信息的可获取性。
  • 评估聊天机器人生成的患者特定问题答案的准确性、相关性、全面性和连贯性。
  • 在标准化评估框架下比较不同提示场景与问题类型的表现。

提出的方法

  • 使用公开的 MIMIC-III 子集(TREC CDS 2016)的入院记录作为来源笔记。
  • 为每条笔记创建三类问题类别(一般性、具体性、不可回答),每类各5道问题。
  • 测试两种会话场景:每次会话1个问题(1QpS)和每次会话1个主题(1TpS)。
  • 由人工评估者以4个标准(准确性、相关性、覆盖范围、连贯性)在1–5分刻度对聊天机器人回答进行评估。
  • 应用 Kruskal-Wallis 检验来评估会话类型、问题类型和模型之间的统计差异。

实验结果

研究问题

  • RQ1LLM 基于聊天机器人是否能够准确回答来自临床笔记的患者特定问题?
  • RQ2不同会话设置(1QpS 与 1TpS)如何影响答案质量?
  • RQ3问题类型(一般、具体、不可回答)对准确性、相关性、覆盖范围和连贯性有何影响?
  • RQ4不同模型(ChatGPT 3.5/4、Claude、Bard)在此任务上是否表现有差异?
  • RQ5评估指标与样本量对结果的稳健性如何?

主要发现

  • ChatGPT 3.5 和 Claude 在所有问题类型和场景中均给出准确、相关、全面且连贯的答案。
  • Kruskal-Wallis 检验显示按会话场景、问题类型或 AI 模型没有统计学显著差异(p>0.05)。
  • 在 General、Specific 和 Non-answerable 问题的 1QpS 和 1TpS 场景下,平均准确性、相关性、覆盖范围和连贯性均保持较高水平(具体数值在研究表中给出)。
  • 研究使用的数据集较小,且评估由单一评审进行,存在潜在偏差,需要更广泛的验证。
  • 结果表明大语言模型在临床笔记的患者特定问答方面具有潜力,但需要进一步工作以改进全面性和连贯性,并评估更多模型与更大数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。