[论文解读] Audio De-identification: A New Entity Recognition Task
本文提出了一种新型任务——音频去标识化,用于保护临床音频记录中的个人健康信息(PHI)。该方法提出一个结合自动语音识别(ASR)、基于文本的命名实体识别(NER)以及音视频对齐的处理流程,以检测并遮蔽PHI片段,在50%覆盖阈值下实现了0.53的召回率,尽管ASR和对齐组件的误差累积导致性能下降。
Named Entity Recognition (NER) has been mostly studied in the context of written text. Specifically, NER is an important step in de-identification (de-ID) of medical records, many of which are recorded conversations between a patient and a doctor. In such recordings, audio spans with personal information should be redacted, similar to the redaction of sensitive character spans in de-ID for written text. The application of NER in the context of audio de-identification has yet to be fully investigated. To this end, we define the task of audio de-ID, in which audio spans with entity mentions should be detected. We then present our pipeline for this task, which involves Automatic Speech Recognition (ASR), NER on the transcript text, and text-to-audio alignment. Finally, we introduce a novel metric for audio de-ID and a new evaluation benchmark consisting of a large labeled segment of the Switchboard and Fisher audio datasets and detail our pipeline's results on it.
研究动机与目标
- 定义并形式化临床对话中音频去标识化的任务。
- 开发一个结合ASR、文本NER和音视频对齐的处理流程,以检测并遮蔽音频中的PHI。
- 基于Switchboard和Fisher音频数据集,构建一个包含人工标注PHI片段的新基准数据集。
- 提出一种新型评估指标Recallρ和Precisionρ,用于衡量对词语部分遮蔽(至少ρ比例)的效果。
- 端到端评估处理流程的整体性能及各组件性能,识别关键错误来源和性能瓶颈。
提出的方法
- 该流程首先使用自动语音识别(ASR)对音频进行转录,生成词级别的时序标记。
- 使用最先进的模型(Lample et al., 2016)对ASR转录文本应用命名实体识别(NER),识别文本中的PHI片段。
- 利用ASR生成的词级别时间边界,执行文本到音频的对齐,将NER预测结果映射回原始音频。
- 对识别出的PHI词语对应的音频片段执行遮蔽,覆盖阈值ρ可配置,用于部分遮蔽。
- 定义了一种新型评估指标Recallρ和Precisionρ,用于评估PHI词语被遮蔽的程度(至少ρ比例),同时保留非PHI内容。
- 通过在Switchboard和Fisher数据集的大量子集中标注PHI片段,构建了新基准SWFI,支持在真实对话音频上进行评估。
实验结果
研究问题
- RQ1结合ASR、NER和对齐的流程在临床音频PHI去标识化中的有效性如何?
- RQ2ASR和对齐组件的误差累积在多大程度上降低了端到端性能,相较于基于文本的NER?
- RQ3ASR的替代词候选和置信度分数的选择如何影响遮蔽的鲁棒性?
- RQ4通过覆盖阈值ρ实现的部分遮蔽对音频去标识化中的召回率和精确率有何影响?
- RQ5PHI词与非PHI词在遮蔽覆盖度方面的性能特征有何不同?
主要发现
- 该流程在覆盖阈值ρ=0.5时实现了0.53的端到端召回率,高于由误差累积推导出的预期召回率0.44,表明存在非平凡的误差共现依赖关系。
- M_SWFI_MixCase+Asr模型在端到端评估中表现优于其他变体,表明在混合大小写转录文本和ASR产物上进行训练可提升鲁棒性。
- PHI词的词错误率(WER)为17.5%,非PHI词为10.5%,表明ASR错误显著影响去标识化性能。
- 非PHI词的覆盖度分布呈双峰特征——主要集中在0或1附近,而PHI词的覆盖度主要超过50%,表明对齐和分类错误对非PHI词的影响方式不同。
- 结合ASR替代词候选可略微提升M_SWFI_MixCase+Asr模型的性能,但简单的OR融合策略因引入低置信度候选而降低性能,凸显了对更优融合策略的需求。
- 填充大小并未提升性能,但改变了最优覆盖阈值,表明对输入预处理选择较为敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。