[论文解读] Speech recognition for medical conversations
本论文提出了一种端到端的语音识别系统,用于转录医生与患者之间的医疗对话,结合了连接时序分类(CTC)和听、注意并拼写(LAS)模型。该系统在14,000小时的匿名临床语音数据上进行训练,LAS模型实现了18.3%的词错误率(WER),在噪声 transcripts 上表现出强鲁棒性,优于需要大量数据清洗和语言模型适配才能达到20.1% WER的CTC基模型。
In this work we explored building automatic speech recognition models for transcribing doctor patient conversation. We collected a large scale dataset of clinical conversations ($14,000$ hr), designed the task to represent the real word scenario, and explored several alignment approaches to iteratively improve data quality. We explored both CTC and LAS systems for building speech recognition models. The LAS was more resilient to noisy data and CTC required more data clean up. A detailed analysis is provided for understanding the performance for clinical tasks. Our analysis showed the speech recognition models performed well on important medical utterances, while errors occurred in causal conversations. Overall we believe the resulting models can provide reasonable quality in practice.
研究动机与目标
- 开发一种可扩展的自动语音识别(ASR)系统,用于转录真实世界中的医生-患者医疗对话。
- 应对多说话人、长时程临床对话中存在重叠语音、音频质量不稳定以及领域特定词汇等挑战。
- 比较基于CTC的模型与端到端LAS模型在处理噪声数据和实现临床相关内容高精度方面的有效性。
- 评估模型在关键医疗短语和药物名称识别方面的性能,这些是临床文档记录的关键要素。
- 证明端到端模型可减少对人工数据清洗和外部语言模型的依赖,相较于传统CTC方法更具优势。
提出的方法
- 基于上下文相关音素输出和连接时序分类损失,构建基于CTC的ASR系统,并采用基于FST的解码器。
- 开发了双向和单向CTC模型,均结合了领域匹配的n-gram语言模型和发音词典。
- 实现了一个基于编码器-解码器架构的端到端LAS模型,利用自注意力机制生成音素级转录。
- 应用两阶段的数据分割与清洗策略,以提升14,000小时语料库中对齐质量和转录质量。
- 在LAS模型中应用调度采样和多头注意力机制,以提高鲁棒性并降低错误率。
- 开展广泛的消融研究,包括MTR(模型调优与重训练)和EMBR(错误建模与反向传播优化),以优化性能。
实验结果
研究问题
- RQ1在存在重叠语音和音频质量不稳定的现实医疗对话数据中,CTC与LAS模型的性能表现如何比较?
- RQ2与端到端LAS模型相比,数据质量对基于CTC的模型影响程度如何?
- RQ3端到端LAS模型是否能在不依赖外部语言模型的情况下,实现对临床关键短语的高精度识别?
- RQ4这些模型在识别口语临床对话中的关键医疗术语(尤其是药物名称)方面有多有效?
- RQ5数据清洗和语言模型适配对基于CTC的系统与LAS模型性能的贡献分别是什么?
主要发现
- LAS模型实现了18.3%的词错误率(WER),优于经过大量数据清洗和语言模型整合后仅达到20.1% WER的CTC模型。
- LAS模型对噪声转录表现出强适应能力,且无需外部语言模型;而CTC模型则需大量数据预处理和匹配的语言模型才能达到可接受性能。
- 在临床重要短语上,双向CTC模型实现了92%的精确率和86%的召回率,表明其在关键医疗内容识别上表现优异。
- LAS模型在识别与治疗相关的药物名称方面实现了98.2%的召回率,凸显其在捕捉关键医疗术语方面的有效性。
- 错误分析显示,CTC模型在短说话人片段(<1秒)、重叠语音和话语不连贯方面表现最差,常导致口语化内容被删除或错误转录。
- LAS模型的主要错误与常见词汇的声学建模有关(例如,'Don’t pay a penny' → 'Don’t byetta penny'),表明其能有效学习语言模式,但可能混淆发音相似的词汇。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。