[论文解读] A preliminary study on evaluating Consultation Notes with Post-Editing
本研究提出后编辑作为医疗领域自动化门诊记录生成的实用评估方法,即医生对AI生成的记录进行修改而非从零开始撰写。结果显示,后编辑比从零开始撰写更快,平均用时23分钟对比36分钟,表明存在时间节省潜力并具备临床应用前景,尽管医生记录风格存在差异。
Automatic summarisation has the potential to aid physicians in streamlining clerical tasks such as note taking. But it is notoriously difficult to evaluate these systems and demonstrate that they are safe to be used in a clinical setting. To circumvent this issue, we propose a semi-automatic approach whereby physicians post-edit generated notes before submitting them. We conduct a preliminary study on the time saving of automatically generated consultation notes with post-editing. Our evaluators are asked to listen to mock consultations and to post-edit three generated notes. We time this and find that it is faster than writing the note from scratch. We present insights and lessons learnt from this experiment.
研究动机与目标
- 为解决在临床环境中评估自动化门诊记录生成系统所面临的挑战,因为内在指标可能无法确保安全性或准确性。
- 调查在半自动工作流下,后编辑AI生成的记录是否比从零开始撰写更快,以评估其在现实世界中的可行性。
- 探讨医生记录风格以及生成记录的质量对后编辑时间和工作量的影响。
- 识别后编辑工作流中与临床采纳相关的可用性和认知负荷挑战。
- 为后编辑作为临床NLP系统可行且高效的时间评估与部署策略奠定基础。
提出的方法
- 在3名初级 care 医生中开展受控实验,评估来自专有数据集的57个模拟会诊。
- 每位医生首先听取会诊录音并从零开始撰写一份面向患者的记录,随后对来自两个不同模型的三份AI生成记录进行后编辑。
- 测量并比较两项任务(从零开始撰写 vs. 后编辑)所用时间,以评估时间节省情况。
- 使用自定义标注平台记录编辑时间,并收集关于可用性和认知努力的定性反馈。
- 通过分析编辑模式、记录质量评分和医生反馈,评估一致性、错误情况及工作流影响。
- 未来工作计划对任务顺序进行随机化,以减少时间测量中的顺序偏差。
实验结果
研究问题
- RQ1在模拟临床环境中,后编辑AI生成的门诊记录是否比从零开始撰写更快?
- RQ2生成记录的质量(如正确性、完整性)在多大程度上影响后编辑时间和工作量?
- RQ3个体医生的记录风格在多大程度上影响后编辑表现和耗时?
- RQ4与从零开始撰写相比,后编辑存在哪些认知和可用性挑战?
- RQ5后编辑能否作为临床摘要系统可靠且外在的评估指标?
主要发现
- 后编辑AI生成的记录显著快于从零开始撰写,平均耗时23分钟,而从零开始撰写平均耗时36分钟。
- 参考记录(由医生撰写)通常比后编辑AI生成记录更快,但在某些情况下,后编辑AI记录耗时更长,原因在于质量缺陷。
- 医生的记录风格差异显著:一名医生撰写更简短、更简洁,编辑次数更少;另一名医生更细致,编辑耗时更长。
- 遗漏或错误陈述较多的记录需要更长的编辑时间,表明质量与编辑工作量之间存在相关性。
- 一名医生因某份AI记录质量过低而完全放弃后编辑,转而复制了其原始记录,表明工作流中存在潜在失败点。
- 后编辑过程中感知到的认知负荷更高,医生表示需要付出更多心理努力来批判性地评估和纠正AI输出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。