[论文解读] Understanding Medical Conversations: Rich Transcription, Confidence Scores & Information Extraction.
本文提出了一种基于流式Transformer的RNN-T模型,用于长时医疗对话的丰富转录,整合了说话人分割、标点符号、大写字母和置信度评分。该模型在ASR任务上达到20%的WER,在置信度估计上达到0.37的NCE,药物标注的F1最高达0.90,通过一种新颖的固定对齐RNN-T标记器,显著提升了临床实体抽取的性能。
In this paper, we describe novel components for extracting clinically relevant information from medical conversations which will be available as Google APIs. We describe a transformer-based Recurrent Neural Network Transducer (RNN-T) model tailored for long-form audio, which can produce rich transcriptions including speaker segmentation, speaker role labeling, punctuation and capitalization. On a representative test set, we compare performance of RNN-T models with different encoders, units and streaming constraints. Our transformer-based streaming model performs at about 20% WER on the ASR task, 6% WDER on the diarization task, 43% SER on periods, 52% SER on commas, 43% SER on question marks and 30% SER on capitalization. Our recognizer is paired with a confidence model that utilizes both acoustic and lexical features from the recognizer. The model performs at about 0.37 NCE. Finally, we describe a RNN-T based tagging model. The performance of the model depends on the ontologies, with F-scores of 0.90 for medications, 0.76 for symptoms, 0.75 for conditions, 0.76 for diagnosis, and 0.61 for treatments. While there is still room for improvement, our results suggest that these models are sufficiently accurate for practical applications.
研究动机与目标
- 开发一种用于长时医疗对话的流式端到端ASR系统,具备丰富的转录能力。
- 利用语音和词汇特征改进医疗ASR中的置信度估计。
- 通过一种新颖的基于RNN-T的命名实体标记模型,实现实体抽取的高精度。
- 通过引入固定对齐训练,解决长对话中序列建模的局限性。
提出的方法
- 采用基于Transformer的RNN-T模型进行流式ASR,通过时间同步的束搜索联合优化声学建模与语言建模。
- 使用包含4种说话人角色的联合RNN-T框架进行说话人分割和角色标注。
- 利用ASR输出的语音和词汇特征训练置信度模型,达到0.37的NCE。
- 提出一种新颖的基于RNN-T的标记器,通过发射时间步建模实体边界和依赖关系。
- 通过约束目标函数至人工标注的对齐路径,应用固定对齐训练,提升长序列上的训练稳定性和性能。
- 利用95k条未标注对话进行自训练,进一步提升罕见或复杂实体的性能。
实验结果
研究问题
- RQ1基于流式Transformer的RNN-T模型能否在长时医疗对话的丰富转录中实现高精度?
- RQ2基于语音和词汇特征的置信度估计方法在临床ASR中与现有方法相比表现如何?
- RQ3固定对齐的RNN-T标记器是否能在临床实体抽取中优于标准RNN-T,尤其是在长序列上?
- RQ4自训练在低资源临床实体类型上的性能提升程度如何?
主要发现
- 基于Transformer的流式RNN-T模型在ASR任务上达到20%的WER,说话人分割的WDER为6%,大写字母识别的SER为30%。
- 置信度模型达到0.37的NCE,表明在临床语音识别置信度估计方面表现优异。
- RNN-T标记器在药物标注上达到0.90的F1,症状为0.76,病症为0.75,诊断为0.76,治疗为0.61。
- 与标准RNN-T相比,固定对齐的RNN-T模型在病症、诊断和属性上的F1得分最高提升0.04。
- 自训练在症状、属性、病症和诊断上带来小而稳定的性能提升,F1最高提升0.02。
- 错误分析显示,由于参考转录存在不准确,尤其是复杂或不完整的短语,自动指标可能低估模型性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。